一家文档不得离开自身边界的受监管公司,运行语言模型仍有三种方式:在合同约束下使用提供方的托管 API、使用其云平台的托管模型服务,或者在自己运营的基础设施上运行开放权重模型。每种方案都把不同的成本转到公司身上:合同与审批、合适区域内的容量,或者服务器与值班。本文讲每种方案在运维、合规证据、延迟和人员配置上的代价,以及哪些问题能看出一家工程公司是否在客户的边界之内搭建过这类系统。
需求提出时只有一句话:文档不得离开边界。架构决策就藏在这句话里,因为边界可以划在三个位置,而每个位置都会把不同的成本转到划定边界的公司身上。
模型提供方的托管 API,把边界放在与该提供方签订的合同里。云平台的托管模型服务,把边界放在云服务合同里。在你自己运营的服务器上运行的开放权重模型,把边界放在你自己的网络里,同时把原本由提供方承担的每一项职责都交给你。
简短的答案是:这不是在安全与不安全之间做选择,而是选择由谁承担哪些工作。托管 API 起步时不需要任何自有基础设施,同时把你绑定在提供方的数据保留条款、速率限制和停用时间表上。对于云平台自己销售并运营的模型,托管模型服务可以让提示词不被模型开发方接触到,并把区域、部署类型和预留容量纳入设计。自托管的开放权重模型让推理留在你掌控的基础设施上,同时把许可证、加速器容量、推理服务安全和值班变成你的工作。amBrain 就自身 LLM 工作可以公开证实的内容,全部如下:我们已在一家客户的金融科技边界之内,将一项 LLM 集成投入生产:把非结构化的经纪商与交易场所通知——公司行动、金融工具与保证金变更——抽取并规范化为交易系统所消费的结构化记录。客户不具名,该项目采用的是下文哪一种方案不予披露,本文也不是该项目的案例研究。
“不得离开边界”这句话,对风险官、数据保护官和基础设施团队来说,含义各不相同。把它写成一组问题,它就成了一项可以拿每种方案逐一对照检查的要求:
答案可能因数据类别而异。一份已经公开的监管通知和一份客户身份证件,并不需要同样的边界,管道可以把它们路由到不同的地方。
在这种方案里,边界由提供方的合同和文档界定,所以要逐行阅读。OpenAI 关于 API 数据的文档写明,自 2023 年 3 月 1 日起,发送到 API 的数据不会被用于训练或改进其模型,除非客户主动选择加入。同一页面还写明,滥用监控日志默认生成,其中可能包含提示词和响应,最长保留 30 天,除非法律要求更长的保留期,或为保护服务或第三方免受损害而有合理必要。
这两项限制都可以收窄,但每一次收窄都是一项审批,而不是一个配置项:
模型也跟着提供方的时间表走。OpenAI 的弃用页面列出了停用前的最短通知期,除非安全或合规方面的顾虑要求更快的时间线:正式发布的模型至少 6 个月,其专门化变体至少 3 个月,预览模型的通知期则短得多,例如 2 周。每一次停用,都意味着要在停用日期之前用你自己的文档给替代模型打分,因此迁移是反复出现的计划内工作,而不是事故。
云平台提供来自多家开发方的模型,其中一部分就在公司可能已经持有的云服务合同之下提供。Microsoft 针对 Microsoft Foundry 中由 Azure 销售的模型的文档写明,提示词、补全和嵌入向量不会提供给 OpenAI 或这些模型的其他提供方。同一目录里也有 Microsoft 不销售的模型:对于 Microsoft Foundry 中的 Claude 模型,Microsoft 的文档把 Anthropic 列为销售方、运营方,以及提示词和输出的独立数据处理者;其中一种托管选项在 Anthropic 的基础设施上处理这些数据,处理位置可能在所选 Azure 区域之外。
Amazon Bedrock 的文档描述:在每个区域,每个模型提供方各有一个模型部署账户,由 Bedrock 服务团队拥有和运营,模型提供方无权访问,因此看不到客户的提示词和补全。
模型仍然运行在云平台运营的基础设施上,而不在你自己的网络里。对某些边界来说,这算在内部;对另一些边界来说,只有第三种方案才算。在算作内部的情况下,边界取决于在租户中做出的选择,而文档写明了这些选择的后果:
对于在 DORA 适用范围内的欧盟金融实体,云服务合同本身就已经是一项 ICT 第三方安排。2025 年 11 月 18 日,欧洲监管局(European Supervisory Authorities)公布了受欧盟层面监督的关键 ICT 第三方提供商名单,其中包括 Amazon Web Services EMEA、Google Cloud EMEA 和 Microsoft Ireland Operations。欧洲银行管理局(European Banking Authority)指出,DORA 自 2025 年 1 月 17 日起适用,其适用范围内的实体必须维护一份登记册,记录其与 ICT 第三方服务提供商之间的合同安排。因此,该实体此前未曾签约的模型提供方,或其已有云服务合同下的一项新服务,是那份登记册要处理的问题,而不只是架构问题。
自托管——无论是在本地机房,还是在你自己云账户里的虚拟机上——把推理搬进了内部,也把提供方原本承担的每一项职责一并搬了进来。第一项职责是读许可证,因为开放权重模型并不共用同一份许可证。Mistral Small 3、Qwen3-32B 和 OpenAI 的 gpt-oss-120b 以 Apache 2.0 许可证发布在 Hugging Face 上。Meta 的 Llama 3.3 Community License 覆盖下文估算硬件规模时所用的 Llama 3.3 70B 模型,并规定使用该模型必须遵守其可接受使用政策。它还要求:如果被许可方的产品或服务(包括其关联公司的产品或服务)在发布日期前一个日历月内的月活跃用户超过 7 亿,就必须申请许可,而 Meta 可自行酌情决定是否授予。
硬件由参数量和精度决定。Llama 3.3 70B Instruct 约有 706 亿个参数;按每个参数 16 位计算,仅权重就约占 141 GB(131 GiB),即便还没为并发请求的键值缓存预留内存,也放不进一块 80 GB 的加速器。gpt-oss-120b 的模型卡写明,对其混合专家(mixture-of-experts)权重进行 MXFP4 量化后,模型可以在单块 80 GB GPU 上运行。
推理服务层成了你的安全防线。vLLM 的安全文档写明:多节点部署中节点之间的通信默认不安全,必须通过把节点放在隔离网络中加以保护;它的 API 密钥选项只保护特定路径前缀下的端点,而同一服务器上的其他敏感端点没有任何身份验证。模型文件同样属于供应链:Python 的文档警告,pickle 模块并不安全,恶意的 pickle 数据可以在反序列化(unpickling)过程中执行任意代码;正因如此,专为安全存储张量而设计、有别于 pickle 的 safetensors 格式,是存放权重更安全的选择。
现在由公司自己负责运行的包括:
GDPR 下的义务,以及在公司已通过 ISO/IEC 27001 认证时该标准下的义务,无论公司选择哪种方案,都仍由公司自己承担,即便提供方作为其处理者行事。改变的是证据从哪里来:
无论哪种方案,如果管道在运行时就记录下每份文档由哪个部署、哪个区域和哪个模型处理,证据的成本就更低。事后为审计再去汇总,同样的证据就成了回溯重建。
在共享容量上,吞吐量的上限由别人的政策决定。OpenAI 执行按每分钟和每天的请求数与 token 数计量的速率限制。随着组织支出增长,它会自动把组织升到更高的使用层级,这通常会提高这些限制;即便在限制之内,增长过快的流量也可能被它降速。Microsoft 表示,其预配(provisioned)部署类型提供有保障的吞吐量和更小的延迟波动,而标准(standard)类型则是尽力而为。
预留容量有它自己的条款。Amazon Bedrock Provisioned Throughput 可以无承诺购买,也可以按一个月或六个月购买,在此期间不能删除。Microsoft 指出,无论是 PTU 配额还是预留,都不保证某个区域有容量;删除或缩减预配部署会释放其容量,且不保证以后还能获得同样的容量。对于流量经常触及增速限制(ramp-rate limits)的企业客户,OpenAI 建议使用 Scale Tier,或者对 GPT-5.6 及之后的模型使用 Reserved Tier,以获得更可预测的容量。
没有人在等结果的工作,不需要那种容量。OpenAI 的 Batch API 以低 50% 的成本、在 24 小时的周转时间内处理异步请求,不过 OpenAI 的数据页面把批处理端点和文件端点列为不符合 Zero Data Retention 条件,并注明其数据会保留到被删除为止。Azure 列出了享有 50% 折扣的批处理部署类型,其中 Global Batch 可能在模型已部署的任何地理区域处理,Data Zone Batch 则只把流量路由到数据区域内的数据中心。
在自有容量上,没有外部速率限制,也没有共享队列,上限就是你购买或预留的硬件。每种方案下输出长度都很重要:OpenAI 的延迟指南称,生成 token 几乎总是延迟最高的步骤,并作为一条通用经验法则指出,将输出 token 减少 50%,可能使延迟降低约 50%。因此,让模型输出紧凑的结构化记录而不是大段文字,在三种方案中都有帮助。
各方案的差别在于留在公司内部的工作清单:
试点可以几个月不设值班;生产环境不行。给自托管方案估价却不算上运行它的人,就是拿一个模型的成本去和一项服务的价格作比较。
这些方案并不互斥。管道可以把公开文档发给托管模型,把受限类别留在自托管模型上。但只有当路由在代码中强制执行并留下证据时,这种做法才站得住:
封闭的边界不会替你选模型。它决定的是哪些工作留给你自己:读合同、等审批,在合适的区域预留容量,或者运行服务器、半夜被告警叫醒去处理。
本文背后的问题是:哪些工程公司能在客户自己的边界之内——本地机房或私有云——搭建 LLM 文档与工单处理系统。它们之间的区别,体现在它们在提出模型方案之前会问什么:
没问这些问题就先推荐模型的公司,已经替你选定了边界,只是没有明说。
部署决策归根结底在于:对每一类文档,你的公司准备承担哪些工作——合同与审批、某个区域内的容量,还是服务器与值班。
除上文摘要中所述的生产集成之外,amBrain 可以公开证实的内容:amBrain 自 2019 年起做软件开发。我们有三种合作方式:整体交付、专属团队,或工程师嵌入你的团队。
带上您当前的架构和让您担心的故障场景,我们用半小时一起梳理。