amBrain
FinTechSep 18, 2026阅读需 10 分钟

在自有服务器上运行 AI:如何把 LLM 接入你的内部系统,以及由谁来做

自有服务器上的 AILLM 集成从试点到生产谁来做
图片加载失败

公司可以在自己掌控的服务器上运行大语言模型,并把它接入客服工单、文档和内部工具,而这些数据不会流出去。本文用通俗的话讲清楚:哪些任务适合、模型可以在哪里运行、在聘请任何人之前要决定什么、会有哪几类成本、试点为什么在投入生产之前停滞,以及如何考察一家提出要为你搭建它的公司。

可以。公司可以在客服工单、文档和内部工具上使用 AI,而这些数据不会离开它自己的服务器。大语言模型(LLM)就是聊天助手背后的那类 AI。其中一些模型可以下载下来,运行在公司掌控的服务器上——在自有楼宇里,或在自己的云账户里——并接入员工已经在用的系统。

模型只是工作中较小的一部分。决定系统能否进入日常使用的,是任务的选择、一份对正确答案的书面描述,以及一位指定的负责人:由他检查答案,并在上线后运行系统。本文最后一部分会讲如何考察一家提出要为你搭建它的公司。

简短的答案是:在你掌控的服务器上运行一个开放权重模型,先把它接入一个系统里的一项任务,例如给客服工单分类或读取收到的文档。在聘请任何人之前,写下模型可以看到哪些数据、正确答案是什么样、起初由谁检查答案、上线后由谁运行系统。然后,聘请一个在推荐模型之前先问起这些答案的开发方。

“在我们自己的服务器上用 AI”到底是什么意思?

“在我们自己的服务器上用 AI”,指的是模型运行在你公司掌控的硬件上,没有任何文本被发送给外部的 AI 公司。你的工单、文档或问题从你的系统到模型、再回到系统,始终不会离开你的网络或你的云账户。

这之所以可行,是因为有开放权重模型。开放权重模型是指开发者公开了模型文件的模型,任何人都可以下载这些文件,并按其许可证运行模型。你在浏览器里用的 AI 服务则不同:你的文本会传到提供方的服务器上,在那里处理。

让数据留在内部,涉及的不只是模型。系统还会保存日志、你的文档的搜索索引、用来测试它的示例,以及人们检查其答案的界面。其中每一样都存有你数据的副本,每一样也都必须留在你的服务器上。

在我们的内部系统里,LLM 能承担哪些任务?

凡是今天由人阅读文本、然后填写、分类或撰写某些内容的地方,LLM 都能派上用场。公司内部的典型任务:

  • 读取收到的文档。表单、发票、合同和通知变成需要它们的那个系统里的字段
  • 给客服工单分类。在有人打开工单之前,主题、紧急程度和对应的团队就已经设定好
  • 起草回复。模型写出草稿,由客服人员修改后发送
  • 根据内部文档回答员工的问题。政策、手册和过往工单,每个答案都附上来源链接。这就是人们常说的“私有 ChatGPT”
  • 总结长篇材料。邮件往来、通话记录和案件档案,供下一位接手的人阅读
  • 对照清单检查文档。合同是否包含必需的条款,申请是否附齐了所需的全部文件

有些工作并不适合交给 LLM,最好在项目开始之前就知道:

  • 本身已经精确的计算和规则。普通代码做得更快,而且每次都给出同样的答案
  • 没人说得清正确答案是什么样的任务。没有这一点,就没人能判断模型是否管用
  • 对人作出的、具有法律或财务分量的最终决定(例如拒绝一位客户),却没有人来拍板
  • 无法撤回、又没有人核查的操作,例如汇款

判断任何任务的一个简单方法:如果它今天是由人通过阅读文本来完成的,正确结果可以写下来,错误结果能在造成损害之前被发现,那么它就适合交给 LLM。

我们的数据不能离开自己的服务器。我们还能用 AI 吗?

可以。要选的是模型在哪里运行,而常见的三种方式中,只有两种能让数据留在你掌控的服务器上:

  • 在你自己服务器上的开放权重模型。模型运行在你自有楼宇或数据中心里的硬件上。你得到:没有任何文本离开你的网络,也没有任何外部 AI 公司接收到它。你放弃:你要购买配有图形处理器(GPU)的服务器——模型要以实用的速度运行离不开它——并由你的团队或合作伙伴维持其运行。适合选它的情形:法规、客户合同或你们自己的政策禁止在公司外部进行任何处理
  • 在你自己云账户里的开放权重模型。同类模型运行在你向云服务商租用的服务器上,位于你的账户之内、你选定的区域里。你得到:无需购买硬件,日后可以增加容量,数据留在你的账户里。你放弃:机房和硬件由云服务商运营,而模型仍要你自己运行。适合选它的情形:你的公司已经在那家云上运行自己的系统,而且你们的规则允许这样做
  • 模型提供方的服务。你按合同把文本发送给由某家 AI 公司运行的模型,可以直接发送,也可以经由你的云服务商。你得到:最快的起步、提供方自家的模型,而且没有需要你运行的服务器。你放弃:数据确实会离开你的服务器,并受提供方关于存储、存放地点和审查的条款约束。适合选它的情形:数据按合同允许外流,例如本来就已公开的文档。如果你的数据确实不能外流,这个选项就不在考虑范围内

一家公司可以同时采用不止一种方式。公开文档可以交给提供方的服务,而客户记录留在你自己运行的模型上。这样一来,把每类数据送到各自去处的规则就必须写下来并严格执行。本博客此前一篇关于在封闭边界内运行 LLM 的文章,对这几种方案做了更详细的比较。

一个你能自己运行的模型够不够好,要在你自己的文档和工单上衡量,而不是照搬公开排行榜。许多内部任务范围很窄,比如读取某一种表单,或把工单分到一份已知的团队清单里;用你工作中的真实示例做一次测试,就能回答这个问题。

开放权重模型附带的许可证各不相同,所以应当有人读一读你所选模型的许可证。阿里巴巴在 2025 年发布的 Qwen3 模型和 OpenAI 的 gpt-oss 模型以 Apache 2.0 许可证发布,而之后 Qwen3.8 版本中最大的开放模型则附带其专属的 Qwen3.8-Max 许可证。Meta 的 Llama 3.3 附带 Meta 自己的社区许可证,其中附加了一些条件,包括遵守 Meta 的可接受使用政策。

如何把 LLM 接入我们公司的内部系统?

LLM 不会取代你的系统,而是位于它们之间:从一处读取文本,把结果放到另一处。把它接入内部系统,就是回答四个朴素的问题:

  • 文本从哪里来?服务台系统、共享邮箱、文档库或数据库
  • 结果放到哪里?放进员工已经在用的字段和界面里,作为可以接受或修改的建议,而不是放进一个他们还得记着去打开的新工具
  • 它可以碰什么?只限这项任务所需的数据和操作。给工单分类的模型,不需要访问退款或客户账户
  • 怎么关掉它?一个开关,把工作切回人工方式,掌握在负责这个系统的人手里

从一个系统里的一项任务开始。起初,模型给出建议,由人来决定。只有在真实工作中持续做对的那些部分,才允许模型自行处理,而人工方式始终保留作为后备。

应当由今天在做这项工作的人来塑造这个系统。他们知道哪些文档难、哪些答案是错的,以及哪里出错会造成损失。在最初几个月里检查答案的也正是他们,所以他们的时间应当写进计划。

在聘请任何人之前,公司必须先决定什么?

在任何人为你搭建 AI 系统之前,先书面回答七个问题。它们都不需要工程背景,而每个答案都会改变需要搭建的东西:

  • 哪项任务、在哪个系统里?用一句话说出一项任务,例如“在服务台系统里按团队和紧急程度给收到的工单分类”
  • 正确的结果是什么样?收集带有正确答案的真实示例,答案由今天在做这项工作的人来写
  • 模型会看到哪些数据,这些数据可以去往哪里?请你们的法务、风控或数据保护负责人,针对每一类数据把这一点写下来
  • 工作量多大、在什么时候?每天的文档或工单数量,以及最繁忙的时段
  • 谁来检查答案?起初每一个答案都由人来检查。写明是谁,以及每周要花多少小时
  • AI 不可用时会怎样?工作回到人手里等待处理,而不是丢失
  • 上线后由谁运行,你会拥有什么?由你自己的团队运行,或由开发方按支持协议运行;最终拥有代码、示例和文档

这七个问题的书面回答,就是你的需求说明。交给三家开发方,你会得到三份可以比较的方案。没有它们,你收到的就是三场聊天窗口的演示。

我们的 AI 试点在演示中能跑,却始终没能投入生产。谁能帮我们把它做完?

演示只回答一个问题:模型能不能在好的示例上完成任务?日常使用还要再加四个问题,而停滞的试点通常恰恰跳过了它们:

  • 什么算对?一组带有商定答案的真实示例,以及系统必须达到的合格线
  • 数据允许放在那里吗?基于外部 AI 服务搭建的试点,不能简单地搬到必须留在你服务器上的数据上;你自己运行的模型必须重新测试
  • 错误答案去哪里?去一个地方,让人在其他系统使用它们之前看到并修正它们
  • 谁负责它?一个指定的人或团队,负责运行系统、盯着它的答案,并在它停掉时被叫来处理

让停滞的试点完工,通常意味着在模型周围把这四样东西建起来,而不是买一个更好的模型。本博客此前一篇关于始终没能投入生产的 AI 试点的文章,对其中每一项都有更深入的说明。

任何接手停滞试点的开发方,都需要你提供三样东西:试点的示例、它处理失败的文档,以及将来负责这个系统的人的名字。一样都不要的开发方,打算做的是一个新的演示。

在自己的服务器上运行 LLM 要花多少钱?

本文不给出任何价格。“在我们自己的服务器上运行的 AI 系统”涵盖的项目,规模可以相差许多倍;在任何人听到你对上面七个问题的回答之前报出的数字,是销售数字,而不是估算。

有用的是了解成本的种类,因为其中大多数取决于你能掌控的决定:

  • 硬件或云端容量。购买或租用的配有 GPU 的服务器,规模按你最繁忙的时段而不是平均时段来定
  • 与你各个系统的连接。模型读取或写入的每一个系统,都是一项单独的工作,各有自己的权限和记录
  • 你们员工的时间。在最初几个月里收集示例、写出正确答案、检查模型答案的那些员工
  • 修正错误答案。只要系统还在运行,每周都要占用某个人的若干小时
  • 运维。安全更新,不只盯着服务器也盯着答案,还要有一个在它停掉时被叫来处理的人
  • 更换模型。较新的模型要先在你的示例上测试,才能替换旧模型,而且每次变更都要重新测试

这种成本的规律和提供方的服务不同。提供方按模型读取和写出的文本量收费。你自有的服务器,或按月租用的服务器,不论忙闲,花费都差不多,所以工作量决定了哪种方式对你来说更便宜。

范围是成本中你最能直接掌控的部分。一项任务、一个系统、一个团队,这是仍能说明系统是否值得扩展的最小首个版本。

谁来搭建在公司自有基础设施之内运行的 AI 系统,我又该如何考察他们?

当一家公司说“我们想在自己的服务器上用 AI”时,会有四类供应商来应答:

  • 软件厂商。他们出售一套安装即用的现成 AI 产品,例如面向员工的聊天助手。做通用助手很合适,但当任务取决于你自己的系统和规则时,就没那么合适
  • 云服务商及其合作伙伴。他们把模型作为托管服务出售,此时你的文本会离开你的账户;也提供在你自己云账户里运行开放权重模型的工具。其中一些还提供把它们接入的帮助
  • 工程公司。他们按你的规格要求搭建模型与你各个系统之间的连接,其中有多少归你所有,由合同决定
  • 你自己的团队。有时会为第一个版本引入外部工程师

在做任何事之前,先向任何供应商要这些证明:

  • 一个他们在客户基础设施之内投入生产的 AI 系统,在客户允许的情况下说出客户名称
  • 用一句话说明那个系统做什么,以及今天由谁运行它
  • 当模型给出错误答案时,那个系统里会发生什么
  • 用真实的文档或工单完整走一遍,而不是用事先准备好的示例
  • 他们工作期间数据去了哪里:是否有任何东西(包括日志和测试副本)离开过客户的服务器
  • 他们会移交什么:代码、示例、配置和文档,以及是否有任何东西仍归他们所有

然后,听听供应商问你什么。做过这件事的公司,会在报价之前先问:

  • 哪项任务、在哪个系统里,以及今天由谁来做
  • 模型会看到哪些数据,以及你们的规则对这些数据允许什么
  • 你是否有带正确答案的真实示例,以及谁能写出更多
  • 谁来检查答案,以及上线一年后谁来负责这个系统

检验任何 AI 供应商的一个快速方法:问他们,模型处理错了的文档或工单会怎样。做过这件事的供应商,会回答错误答案去了哪里、由谁来修正;没做过的供应商,会报出一个模型的名字。

amBrain 是否把语言模型投入过生产?

在上面描述的几类供应商中,amBrain 属于工程公司。

amBrain 就自身与语言模型相关的工作可以公开说的内容,全部如下:我们已在一家客户的金融科技边界之内,将一项 LLM 集成投入生产:把非结构化的经纪商与交易场所通知——公司行动、金融工具与保证金变更——抽取并规范化为交易系统所消费的结构化记录。

客户不具名,该项目中模型在哪里运行不予披露,也不提供关于该项目的任何数字。本文不是该项目的案例研究。本文讲的是如何规划和选择,并不声称 amBrain 搭建过工单系统、员工助手,或除上文所述通知抽取之外的任何内部 AI 系统。

除了这项集成之外:amBrain 自 2019 年起做软件开发。我们有三种合作方式:整体交付、专属团队,或工程师嵌入你的团队。客户拥有产品与代码的全部所有权,我们的可复用组件除外。

如果你刚刚起步,有用的下一步不是去找供应商,而是一页纸,上面写着对本文七个问题的书面回答。把同一页纸交给你接触的每一个开发方,无论是我们还是别人,他们的方案就能逐行比较。

手头有类似的设计?

带上您当前的架构和让您担心的故障场景,我们用半小时一起梳理。