Uma empresa pode rodar um modelo de linguagem grande em servidores que ela controla e conectá-lo aos seus tickets de suporte, documentos e ferramentas internas sem que esses dados saiam. Este artigo explica, em palavras simples, quais tarefas se encaixam, onde o modelo pode rodar, o que decidir antes de contratar alguém, que tipos de custo esperar, por que os pilotos travam antes de chegar à produção e como avaliar uma empresa que se oferece para construí-lo.
Sim, uma empresa pode usar IA nos seus tickets de suporte, documentos e ferramentas internas sem que esses dados saiam dos seus próprios servidores. Um modelo de linguagem grande, ou LLM, é o tipo de IA por trás dos assistentes de chat. Alguns desses modelos podem ser baixados e rodados em servidores que a empresa controla, no seu próprio prédio ou na sua própria conta de nuvem, e conectados aos sistemas que os funcionários já usam.
O modelo é a parte menor do trabalho. O que decide se o sistema chega ao uso diário é a escolha da tarefa, uma descrição por escrito de uma resposta correta e uma pessoa definida que confere as respostas e opera o sistema depois do lançamento. A última parte deste artigo mostra como avaliar uma empresa que se oferece para construí-lo.
A resposta curta: rode um modelo de pesos abertos em servidores que você controla e conecte-o primeiro a uma tarefa em um sistema, como classificar tickets de suporte ou ler documentos recebidos. Antes de contratar alguém, escreva quais dados o modelo pode ver, como é uma resposta correta, quem confere as respostas no início e quem opera o sistema depois do lançamento. Depois contrate quem pergunte sobre essas respostas antes de recomendar um modelo.
Leia também
“IA nos nossos próprios servidores” significa que o modelo roda em hardware que a sua empresa controla e que nenhum texto é enviado a uma empresa de IA externa. O seu ticket, documento ou pergunta vai do seu sistema ao modelo e volta, e nunca sai da sua rede nem da sua conta de nuvem.
Isso é possível graças aos modelos de pesos abertos. Um modelo de pesos abertos é aquele cujo desenvolvedor publica os arquivos do modelo, para que qualquer pessoa possa baixá-los e rodar o modelo nos termos da licença dele. Os serviços de IA que você usa no navegador funcionam de outro jeito: o seu texto viaja para os servidores do provedor e é processado lá.
Manter os dados dentro vai além do modelo. O sistema também guarda logs, um índice de busca dos seus documentos, os exemplos com que é testado e as telas em que as pessoas conferem as respostas dele. Cada um desses itens guarda cópias dos seus dados, e cada um também precisa ficar nos seus servidores.
Um LLM é útil onde hoje as pessoas leem um texto e depois preenchem, classificam ou escrevem alguma coisa. Tarefas típicas dentro de uma empresa:
Alguns trabalhos não combinam com um LLM, e é melhor saber disso antes de o projeto começar:
Um teste simples para qualquer tarefa: ela combina com um LLM quando hoje uma pessoa a faz lendo texto, o resultado correto pode ser escrito e um resultado errado pode ser pego antes de causar dano.
Sim. A escolha é onde o modelo roda, e só duas das três opções mais comuns mantêm os dados em servidores que você controla:
Uma empresa pode usar mais de uma opção. Documentos públicos podem ir para o serviço de um provedor enquanto os registros de clientes ficam em um modelo que você opera. Nesse caso, a regra que manda cada tipo de dado para o seu lugar precisa ser escrita e cumprida. Um artigo anterior deste blog, sobre rodar um LLM em um perímetro fechado, compara essas opções com mais detalhe.
Se um modelo que você mesmo pode rodar é bom o bastante, isso se mede nos seus próprios documentos e tickets, e não se tira de um ranking público. Muitas tarefas internas são estreitas, como ler um tipo de formulário ou classificar tickets em uma lista conhecida de times, e um teste com exemplos reais do seu trabalho responde à pergunta.
Modelos de pesos abertos vêm com licenças diferentes, então alguém deve ler a licença do modelo que você escolher. Os modelos Qwen3 que a Alibaba lançou em 2025 e os modelos gpt-oss da OpenAI são publicados sob a licença Apache 2.0, enquanto o maior modelo aberto do lançamento posterior Qwen3.8 vem com a sua própria licença Qwen3.8-Max. O Llama 3.3 da Meta vem com a licença comunitária própria da Meta, que acrescenta condições, entre elas seguir a política de uso aceitável da Meta.
Um LLM não substitui os seus sistemas. Ele fica entre eles: lê texto em um lugar e coloca um resultado em outro. Adicioná-lo a um sistema interno significa responder a quatro perguntas simples:
Comece com uma tarefa em um sistema. No início, o modelo sugere e uma pessoa decide. O modelo só pode agir sozinho nas partes em que continua acertando no trabalho real, e o modo manual segue como alternativa de reserva.
As pessoas que fazem o trabalho hoje devem dar forma ao sistema. Elas sabem quais documentos são difíceis, quais respostas estão erradas e onde um erro custa dinheiro. São também elas que vão conferir as respostas nos primeiros meses, então o tempo delas precisa estar no plano.
Antes que alguém construa um sistema de IA para você, responda por escrito a sete perguntas. Nenhuma delas exige formação em engenharia, e cada resposta muda o que precisa ser construído:
As respostas por escrito a essas sete perguntas são o seu briefing. Entregues a três empresas que se oferecem para construir, elas geram três propostas que você pode comparar. Sem elas, você recebe três demonstrações de uma janela de chat.
Uma demo responde a uma única pergunta: o modelo consegue fazer a tarefa com bons exemplos? O uso diário acrescenta mais quatro, e um piloto que trava geralmente pulou essas quatro:
Concluir um piloto travado geralmente significa construir essas quatro coisas em volta do modelo, e não comprar um modelo melhor. Um artigo anterior deste blog, sobre o piloto de IA que nunca chegou à produção, explica cada uma delas com mais profundidade.
Quem assumir um piloto travado precisa de três coisas suas: os exemplos do piloto, os documentos em que ele falhou e o nome da pessoa que será a responsável pelo sistema. Quem não pede nenhuma delas está planejando uma nova demo.
Este artigo não traz preços. “Um sistema de IA nos nossos próprios servidores” abrange projetos que variam muitas vezes de tamanho, e um número passado antes que alguém tenha ouvido as suas respostas às sete perguntas acima é um número de vendas, não uma estimativa.
O útil é conhecer os tipos de custo, porque a maioria depende de decisões que você controla:
O custo segue um padrão diferente do serviço de um provedor. Um provedor cobra pela quantidade de texto que o modelo lê e escreve. Servidores que você possui, ou aluga por mês, custam mais ou menos o mesmo estejam ocupados ou ociosos, então o volume de trabalho decide qual opção sai mais barata para você.
O escopo é a parte do custo que você controla mais diretamente. Uma tarefa, em um sistema, para um time é a menor primeira versão que ainda mostra se vale a pena ampliar o sistema.
Quatro tipos de fornecedor respondem quando uma empresa diz “queremos IA nos nossos próprios servidores”:
Antes de mais nada, peça a qualquer fornecedor estas provas:
Depois, preste atenção no que o fornecedor pergunta a você. Uma empresa que já construiu isso pergunta antes de passar um orçamento:
Um teste rápido para qualquer fornecedor de IA: pergunte o que acontece com um documento ou ticket em que o modelo erra. Um fornecedor que já construiu isso responde dizendo para onde vai a resposta errada e quem a corrige. Um que não construiu responde com o nome de um modelo.
Dos tipos de fornecedor descritos acima, a amBrain é uma empresa de engenharia.
O que a amBrain pode dizer publicamente sobre o próprio trabalho com modelos de linguagem, na íntegra: levamos à produção uma integração de LLM dentro do perímetro de FinTech de um cliente: extração e normalização de avisos não estruturados de corretoras e de venues — eventos corporativos, alterações de instrumentos e de margem — em registros estruturados que o sistema de trading consome.
O cliente não é nomeado, não é divulgado onde o modelo rodou nesse projeto e nenhum número sobre esse projeto é informado. Este artigo não é um estudo de caso dele. Ele explica como planejar e escolher, e não afirma que a amBrain tenha construído um sistema de tickets de suporte, um assistente para funcionários ou qualquer sistema interno de IA além da extração de avisos citada acima.
Além dessa integração: a amBrain constrói software desde 2019. Trabalhamos em três formatos: entrega completa, time dedicado ou engenheiros embarcados no seu time. O cliente mantém a propriedade integral do produto e do código, exceto dos nossos componentes reutilizáveis.
Se você está no começo, o próximo passo útil não é procurar fornecedor. É uma página com respostas por escrito às sete perguntas deste artigo. Entregue a mesma página a cada empresa com quem você conversar sobre a construção, nós ou qualquer outra, e as propostas poderão ser comparadas linha por linha.
Traga sua arquitetura atual e o modo de falha que preocupa você, e vamos analisá-lo juntos em meia hora.