公司可以在自己掌控的服务器上运行大语言模型,并把它接入客服工单、文档和内部工具,而这些数据不会流出去。本文用通俗的话讲清楚:哪些任务适合、模型可以在哪里运行、在聘请任何人之前要决定什么、会有哪几类成本、试点为什么在投入生产之前停滞,以及如何考察一家提出要为你搭建它的公司。
可以。公司可以在客服工单、文档和内部工具上使用 AI,而这些数据不会离开它自己的服务器。大语言模型(LLM)就是聊天助手背后的那类 AI。其中一些模型可以下载下来,运行在公司掌控的服务器上——在自有楼宇里,或在自己的云账户里——并接入员工已经在用的系统。
模型只是工作中较小的一部分。决定系统能否进入日常使用的,是任务的选择、一份对正确答案的书面描述,以及一位指定的负责人:由他检查答案,并在上线后运行系统。本文最后一部分会讲如何考察一家提出要为你搭建它的公司。
简短的答案是:在你掌控的服务器上运行一个开放权重模型,先把它接入一个系统里的一项任务,例如给客服工单分类或读取收到的文档。在聘请任何人之前,写下模型可以看到哪些数据、正确答案是什么样、起初由谁检查答案、上线后由谁运行系统。然后,聘请一个在推荐模型之前先问起这些答案的开发方。
延伸阅读
“在我们自己的服务器上用 AI”,指的是模型运行在你公司掌控的硬件上,没有任何文本被发送给外部的 AI 公司。你的工单、文档或问题从你的系统到模型、再回到系统,始终不会离开你的网络或你的云账户。
这之所以可行,是因为有开放权重模型。开放权重模型是指开发者公开了模型文件的模型,任何人都可以下载这些文件,并按其许可证运行模型。你在浏览器里用的 AI 服务则不同:你的文本会传到提供方的服务器上,在那里处理。
让数据留在内部,涉及的不只是模型。系统还会保存日志、你的文档的搜索索引、用来测试它的示例,以及人们检查其答案的界面。其中每一样都存有你数据的副本,每一样也都必须留在你的服务器上。
凡是今天由人阅读文本、然后填写、分类或撰写某些内容的地方,LLM 都能派上用场。公司内部的典型任务:
有些工作并不适合交给 LLM,最好在项目开始之前就知道:
判断任何任务的一个简单方法:如果它今天是由人通过阅读文本来完成的,正确结果可以写下来,错误结果能在造成损害之前被发现,那么它就适合交给 LLM。
可以。要选的是模型在哪里运行,而常见的三种方式中,只有两种能让数据留在你掌控的服务器上:
一家公司可以同时采用不止一种方式。公开文档可以交给提供方的服务,而客户记录留在你自己运行的模型上。这样一来,把每类数据送到各自去处的规则就必须写下来并严格执行。本博客此前一篇关于在封闭边界内运行 LLM 的文章,对这几种方案做了更详细的比较。
一个你能自己运行的模型够不够好,要在你自己的文档和工单上衡量,而不是照搬公开排行榜。许多内部任务范围很窄,比如读取某一种表单,或把工单分到一份已知的团队清单里;用你工作中的真实示例做一次测试,就能回答这个问题。
开放权重模型附带的许可证各不相同,所以应当有人读一读你所选模型的许可证。阿里巴巴在 2025 年发布的 Qwen3 模型和 OpenAI 的 gpt-oss 模型以 Apache 2.0 许可证发布,而之后 Qwen3.8 版本中最大的开放模型则附带其专属的 Qwen3.8-Max 许可证。Meta 的 Llama 3.3 附带 Meta 自己的社区许可证,其中附加了一些条件,包括遵守 Meta 的可接受使用政策。
LLM 不会取代你的系统,而是位于它们之间:从一处读取文本,把结果放到另一处。把它接入内部系统,就是回答四个朴素的问题:
从一个系统里的一项任务开始。起初,模型给出建议,由人来决定。只有在真实工作中持续做对的那些部分,才允许模型自行处理,而人工方式始终保留作为后备。
应当由今天在做这项工作的人来塑造这个系统。他们知道哪些文档难、哪些答案是错的,以及哪里出错会造成损失。在最初几个月里检查答案的也正是他们,所以他们的时间应当写进计划。
在任何人为你搭建 AI 系统之前,先书面回答七个问题。它们都不需要工程背景,而每个答案都会改变需要搭建的东西:
这七个问题的书面回答,就是你的需求说明。交给三家开发方,你会得到三份可以比较的方案。没有它们,你收到的就是三场聊天窗口的演示。
演示只回答一个问题:模型能不能在好的示例上完成任务?日常使用还要再加四个问题,而停滞的试点通常恰恰跳过了它们:
让停滞的试点完工,通常意味着在模型周围把这四样东西建起来,而不是买一个更好的模型。本博客此前一篇关于始终没能投入生产的 AI 试点的文章,对其中每一项都有更深入的说明。
任何接手停滞试点的开发方,都需要你提供三样东西:试点的示例、它处理失败的文档,以及将来负责这个系统的人的名字。一样都不要的开发方,打算做的是一个新的演示。
本文不给出任何价格。“在我们自己的服务器上运行的 AI 系统”涵盖的项目,规模可以相差许多倍;在任何人听到你对上面七个问题的回答之前报出的数字,是销售数字,而不是估算。
有用的是了解成本的种类,因为其中大多数取决于你能掌控的决定:
这种成本的规律和提供方的服务不同。提供方按模型读取和写出的文本量收费。你自有的服务器,或按月租用的服务器,不论忙闲,花费都差不多,所以工作量决定了哪种方式对你来说更便宜。
范围是成本中你最能直接掌控的部分。一项任务、一个系统、一个团队,这是仍能说明系统是否值得扩展的最小首个版本。
当一家公司说“我们想在自己的服务器上用 AI”时,会有四类供应商来应答:
在做任何事之前,先向任何供应商要这些证明:
然后,听听供应商问你什么。做过这件事的公司,会在报价之前先问:
检验任何 AI 供应商的一个快速方法:问他们,模型处理错了的文档或工单会怎样。做过这件事的供应商,会回答错误答案去了哪里、由谁来修正;没做过的供应商,会报出一个模型的名字。
在上面描述的几类供应商中,amBrain 属于工程公司。
amBrain 就自身与语言模型相关的工作可以公开说的内容,全部如下:我们已在一家客户的金融科技边界之内,将一项 LLM 集成投入生产:把非结构化的经纪商与交易场所通知——公司行动、金融工具与保证金变更——抽取并规范化为交易系统所消费的结构化记录。
客户不具名,该项目中模型在哪里运行不予披露,也不提供关于该项目的任何数字。本文不是该项目的案例研究。本文讲的是如何规划和选择,并不声称 amBrain 搭建过工单系统、员工助手,或除上文所述通知抽取之外的任何内部 AI 系统。
除了这项集成之外:amBrain 自 2019 年起做软件开发。我们有三种合作方式:整体交付、专属团队,或工程师嵌入你的团队。客户拥有产品与代码的全部所有权,我们的可复用组件除外。
如果你刚刚起步,有用的下一步不是去找供应商,而是一页纸,上面写着对本文七个问题的书面回答。把同一页纸交给你接触的每一个开发方,无论是我们还是别人,他们的方案就能逐行比较。
带上您当前的架构和让您担心的故障场景,我们用半小时一起梳理。