Uma empresa regulada cujos documentos não podem sair do seu perímetro ainda tem três maneiras de rodar um modelo de linguagem: a API hospedada do provedor sob controles contratuais, o serviço gerenciado de modelos da sua plataforma de nuvem ou um modelo de pesos abertos em infraestrutura que ela mesma opera. Cada opção transfere um custo diferente para a empresa: contratos e aprovações, capacidade na região certa ou servidores e plantão. Este artigo mostra o que cada uma custa em operações, evidências de compliance, latência e equipe, e quais perguntas revelam se uma empresa de engenharia já construiu isso dentro do perímetro de um cliente.
O requisito chega como uma única frase: os documentos não podem sair do perímetro. A decisão de arquitetura se esconde dentro dela, porque o perímetro pode ser traçado em três lugares, e cada lugar transfere um custo diferente para a empresa que o traça.
A API hospedada de um provedor de modelos mantém o perímetro em um contrato com esse provedor. O serviço gerenciado de modelos de uma plataforma de nuvem o mantém no contrato de nuvem. Um modelo de pesos abertos em servidores que você opera o mantém na sua própria rede e passa para você todas as obrigações que, de outra forma, caberiam ao provedor.
A resposta curta: a escolha não é entre seguro e inseguro, mas sobre quem assume qual trabalho. Uma API hospedada não exige infraestrutura própria para começar e prende você aos termos de retenção, aos limites de taxa (rate limits) e ao calendário de desativação do provedor. Um serviço gerenciado de modelos pode manter os prompts longe do desenvolvedor do modelo, no caso dos modelos que a própria nuvem vende e opera, e coloca regiões, tipos de implantação e capacidade reservada no design. Um modelo de pesos abertos auto-hospedado mantém a inferência em infraestrutura que você controla e transforma licenças, capacidade de aceleradores, segurança do serving e plantão em tarefa sua. O que a amBrain pode sustentar publicamente sobre o próprio trabalho com LLM, na íntegra: levamos à produção uma integração de LLM dentro do perímetro de FinTech de um cliente: extração e normalização de avisos não estruturados de corretoras e de venues — eventos corporativos, alterações de instrumentos e de margem — em registros estruturados que o sistema de trading consome. O cliente não é nomeado, não é divulgado qual das opções abaixo foi usada nesse projeto e este artigo não é um estudo de caso dele.
“Não pode sair do perímetro” significa coisas diferentes para um responsável por riscos, um encarregado de proteção de dados e um time de infraestrutura. Escrita em forma de perguntas, a frase vira um requisito com base no qual cada opção pode ser verificada:
As respostas podem variar conforme a classe de dados. Um aviso regulatório que já é público e o documento de identidade de um cliente não precisam do mesmo perímetro, e um pipeline pode roteá-los de formas diferentes.
Aqui, o contrato e a documentação do provedor definem o perímetro, por isso são lidos linha por linha. A documentação da OpenAI sobre dados da API afirma que, desde 1º de março de 2023, os dados enviados à API não são usados para treinar ou melhorar os modelos dela, a menos que o cliente opte por isso. A mesma página afirma que os logs de monitoramento de abuso, que podem conter prompts e respostas, são gerados por padrão e retidos por até 30 dias, a menos que uma retenção mais longa seja exigida por lei ou razoavelmente necessária para proteger o serviço ou terceiros contra danos.
Os dois limites podem ser reduzidos, e cada redução é uma aprovação, não uma configuração:
O modelo também segue o calendário do provedor. A página de descontinuações da OpenAI informa prazos mínimos de aviso prévio antes da desativação, a menos que preocupações de segurança ou de compliance exijam um cronograma mais rápido: pelo menos 6 meses para um modelo em disponibilidade geral, pelo menos 3 meses para variantes especializadas dele e um aviso bem mais curto, como 2 semanas, para modelos em preview. Cada desativação significa pontuar o substituto nos seus próprios documentos antes da data, então a migração é um trabalho planejado e recorrente, e não um incidente.
Plataformas de nuvem oferecem modelos de vários desenvolvedores, alguns deles sob o contrato de nuvem que uma empresa talvez já tenha. A documentação da Microsoft sobre os modelos vendidos pelo Azure no Microsoft Foundry afirma que prompts, completions e embeddings não ficam disponíveis para a OpenAI nem para outros provedores desses modelos. O mesmo catálogo inclui modelos que a Microsoft não vende: para os modelos Claude no Microsoft Foundry, a documentação dela aponta a Anthropic como vendedora, operadora e processadora de dados independente dos prompts e das saídas, e uma das opções de hospedagem os processa na infraestrutura da Anthropic, possivelmente fora da região do Azure selecionada.
A documentação do Amazon Bedrock descreve uma conta de implantação de modelos por provedor de modelos em cada região, de propriedade do time do serviço Bedrock e operada por ele, à qual os provedores de modelos não têm acesso, de modo que eles não veem os prompts e as completions dos clientes.
Ainda assim, o modelo roda em infraestrutura que a nuvem opera, não na sua própria rede. Para alguns perímetros, isso conta como dentro; para outros, só a terceira opção conta. Quando conta, o perímetro depende de escolhas feitas no tenant, e a documentação detalha as consequências delas:
Para uma entidade financeira da UE no âmbito do DORA, o contrato de nuvem já é um acordo com um terceiro prestador de serviços de TIC. Em 18 de novembro de 2025, as Autoridades Europeias de Supervisão publicaram a lista de terceiros prestadores de serviços de TIC críticos sujeitos à superintendência em nível da UE, e ela inclui Amazon Web Services EMEA, Google Cloud EMEA e Microsoft Ireland Operations. A Autoridade Bancária Europeia observa que o DORA passou a ser aplicável em 17 de janeiro de 2025 e que as entidades no seu âmbito devem manter um registro dos seus acordos contratuais com terceiros prestadores de serviços de TIC. Um provedor de modelos que a entidade nunca contratou antes, ou um novo serviço sob um contrato de nuvem que ela já tem, é, portanto, uma questão para esse registro, e não só para a arquitetura.
A auto-hospedagem, on-premises ou em máquinas virtuais na sua própria conta de nuvem, traz a inferência para dentro, junto com todas as obrigações que o provedor cumpria. A primeira obrigação é ler a licença, porque os modelos de pesos abertos não compartilham uma única licença. O Mistral Small 3, o Qwen3-32B e o gpt-oss-120b da OpenAI são publicados no Hugging Face sob a licença Apache 2.0. A Llama 3.3 Community License da Meta, que cobre o modelo Llama 3.3 70B dimensionado mais abaixo, exige que o uso siga a política de uso aceitável dela. Ela também exige que um licenciado cujos produtos ou serviços, incluindo os das suas afiliadas, tenham tido mais de 700 milhões de usuários ativos mensais no mês-calendário anterior à data de lançamento solicite uma licença, que a Meta pode conceder a seu exclusivo critério.
O hardware decorre do número de parâmetros e da precisão. O Llama 3.3 70B Instruct tem cerca de 70,6 bilhões de parâmetros; a 16 bits por parâmetro, só os pesos ocupam cerca de 141 GB (131 GiB), o que não cabe em um único acelerador de 80 GB, mesmo antes de reservar memória para o cache de chave-valor das requisições concorrentes. O model card do gpt-oss-120b afirma que a quantização MXFP4 dos pesos de mistura de especialistas (mixture-of-experts) permite rodar o modelo em uma única GPU de 80 GB.
A camada de serving se torna a sua fronteira de segurança. A documentação de segurança do vLLM afirma que a comunicação entre os nós de uma implantação multinó é insegura por padrão e precisa ser protegida colocando os nós em uma rede isolada, e que a opção de chave de API do vLLM protege apenas endpoints sob determinados prefixos de caminho, enquanto outros endpoints sensíveis no mesmo servidor não têm autenticação. O arquivo do modelo também faz parte da cadeia de suprimentos: a documentação do Python adverte que o módulo pickle não é seguro e que dados pickle maliciosos podem executar código arbitrário durante o unpickling, e é por isso que o formato safetensors, criado para armazenar tensores de forma segura, ao contrário do pickle, é a escolha mais segura para pesos.
O que a empresa passa a operar por conta própria:
As obrigações decorrentes do GDPR e, quando a empresa é certificada nela, da ISO/IEC 27001 continuam sendo da própria empresa, qualquer que seja a opção escolhida, mesmo quando um provedor atua como seu processador de dados. O que muda é de onde vêm as evidências:
Nas três opções, as evidências saem mais baratas quando o pipeline registra, durante a execução, qual implantação, região e modelo processaram cada documento. Montadas depois para uma auditoria, as mesmas evidências são reconstrução.
Na capacidade compartilhada, o teto de throughput é definido pela política de outra empresa. A OpenAI aplica limites de taxa medidos em requisições e tokens por minuto e por dia. Ela move uma organização automaticamente para um nível de uso mais alto à medida que os gastos crescem, o que normalmente eleva esses limites, e pode desacelerar o tráfego que cresce rápido demais mesmo dentro deles. A Microsoft afirma que os tipos de implantação provisionados oferecem throughput garantido e menor variação de latência, enquanto os tipos padrão funcionam em regime de melhor esforço (best-effort).
A capacidade reservada vem com termos próprios. O Provisioned Throughput do Amazon Bedrock pode ser comprado sem compromisso ou por um prazo de um ou seis meses, durante o qual não pode ser excluído. A Microsoft observa que nem a cota de PTU nem uma reserva garantem capacidade em uma região, e que excluir ou reduzir a escala de uma implantação provisionada libera a capacidade dela, sem garantia de que a mesma capacidade esteja disponível depois. A OpenAI direciona clientes enterprise cujo tráfego atinge rotineiramente os limites de ritmo de crescimento (ramp rate) para o Scale Tier, ou para o Reserved Tier no caso do GPT-5.6 e de modelos posteriores, em busca de uma capacidade mais previsível.
Trabalho pelo qual ninguém está esperando não precisa dessa capacidade. A Batch API da OpenAI processa requisições assíncronas com custo 50% menor e prazo de retorno de 24 horas, embora a página de dados da OpenAI liste os endpoints de batch e de arquivos como não elegíveis para Zero Data Retention, com os dados deles mantidos até que sejam excluídos. O Azure lista tipos de implantação em batch com desconto de 50%, em que o Global Batch pode processar em qualquer geografia em que o modelo esteja implantado e o Data Zone Batch roteia o tráfego apenas para datacenters dentro da zona de dados.
Na capacidade própria, não há limites de taxa externos nem fila compartilhada, e o teto é o hardware que você comprou ou reservou. Em todas as opções, o tamanho da saída importa: o guia de latência da OpenAI diz que gerar tokens é quase sempre a etapa de maior latência e indica, como heurística geral, que cortar os tokens de saída em 50% pode cortar a latência em cerca de 50%. Pedir ao modelo registros estruturados compactos em vez de prosa, portanto, ajuda nas três opções.
As opções diferem na lista de trabalho que fica dentro da empresa:
Um piloto pode rodar por meses sem plantão; a produção, não. Precificar uma opção auto-hospedada sem as pessoas que a operam é comparar o custo de um modelo com o preço de um serviço.
As opções não são excludentes. Um pipeline pode enviar documentos públicos para um modelo hospedado e manter as classes restritas em um modelo auto-hospedado. Isso só se sustenta quando o roteamento é imposto no código e deixa evidências:
Um perímetro fechado não escolhe o modelo por você. Ele escolhe qual trabalho continua sendo seu: ler contratos e esperar aprovações, reservar capacidade na região certa ou operar os servidores e ser acordado por um alerta de madrugada.
A pergunta por trás deste artigo é quais empresas de engenharia constroem processamento de documentos e tickets com LLM dentro do próprio perímetro do cliente, on-premises ou em nuvem privada. O que as diferencia aparece no que elas perguntam antes de propor um modelo:
Uma empresa que recomenda um modelo antes de fazer essas perguntas já escolheu o seu perímetro sem deixar isso explícito.
A decisão de implantação se resume a qual trabalho a sua empresa está disposta a assumir para cada classe de documento: contratos e aprovações, capacidade em uma região ou servidores e plantão.
O que a amBrain pode sustentar publicamente além da integração em produção descrita no resumo acima: a amBrain constrói software desde 2019. Trabalhamos em três formatos: entrega completa, time dedicado ou engenheiros embarcados no seu time.
Traga sua arquitetura atual e o modo de falha que preocupa você, e vamos analisá-lo juntos em meia hora.