Você pode dar aos funcionários um assistente no estilo do ChatGPT sem que os dados dos clientes saiam da empresa. Antes do uso diário, quem o implantar deve mostrar a você o assistente respeitando as permissões de documentos de cada pessoa e guardando as conversas e os logs pelo tempo que o seu time de compliance decidir.
Um ChatGPT privado é um assistente de chat que funciona como o ChatGPT, mas roda em servidores que a sua empresa controla. Os funcionários fazem login em um app de chat que envia as perguntas deles a um modelo de linguagem nesses servidores, e uma busca nos seus próprios documentos permite que o modelo responda com base neles. Cada uma dessas partes já existe hoje como software open source ou licenciado.
O trabalho está em conectar essas partes ao login corporativo, às permissões de documentos e aos logs da sua empresa, e depois em operar o sistema. O seu time de TI pode montar um teste. Antes que todos os funcionários passem a depender dele, uma empresa regulada deve contratar um time capaz de mostrar cada requisito abaixo funcionando nos próprios sistemas da empresa.
A resposta curta: o seu time de TI pode fazer um teste com documentos que todos do grupo de teste podem ler. Para o uso diário em toda a empresa, contrate um time só depois que ele mostrar o assistente funcionando com o seu próprio login e os seus próprios documentos. O assistente deve esconder os documentos que uma pessoa não pode abrir e manter as conversas e os logs nos seus servidores por um prazo definido pelo seu time de compliance.
Por que as empresas querem um ChatGPT privado?
Os funcionários não estão esperando o empregador fornecer ferramentas de IA. No Work Trend Index 2024 da Microsoft e do LinkedIn, uma pesquisa com 31.000 trabalhadores do conhecimento em 31 países, 78% dos usuários de IA disseram que estavam levando as próprias ferramentas de IA para o trabalho.
Em maio de 2023, a Samsung restringiu temporariamente as ferramentas de IA generativa nos dispositivos e nas redes internas da empresa, depois que dados internos vazaram acidentalmente para o ChatGPT em abril. O TechCrunch relatou a preocupação da Samsung de que dados em servidores externos são difíceis de “recuperar e excluir”. A empresa disse que estava “avaliando medidas para criar um ambiente protegido para usar a IA generativa com segurança”.
Em uma pesquisa com empresas financeiras do Reino Unido que o Banco da Inglaterra e a FCA publicaram em novembro de 2024, a proteção de dados e a privacidade apareceram como a maior restrição regulatória percebida ao uso de IA.
Do que é feito um ChatGPT privado?
“ChatGPT privado” não é o nome de um produto da OpenAI. A expressão descreve um sistema montado a partir de partes separadas, e um modelo da OpenAI, a empresa por trás do ChatGPT, pode ser uma delas. Os projetos open source citados abaixo são exemplos que você pode encontrar em propostas, e este artigo não faz um ranking deles. Estas são as partes:
- O app de chat é a página web em que os funcionários fazem login, fazem perguntas, enviam arquivos e encontram conversas anteriores. O LibreChat é um exemplo open source, sob a licença MIT. A página do projeto lista login corporativo via OAuth2 e LDAP, duas formas comuns de conectar um app às contas que os funcionários já têm. Ele também funciona com qualquer servidor de modelo que aceite requisições no formato do próprio serviço da OpenAI, o que se chama de API compatível com a OpenAI (OpenAI-compatible API)
- O servidor de modelo roda o modelo de linguagem no seu hardware e responde às requisições do app de chat. O vLLM é um exemplo open source. A documentação dele diz que ele “implementa a Completions API e a Chat API da OpenAI, entre outras”, então um app de chat escrito para o serviço da OpenAI pode enviar as perguntas ao seu servidor em vez disso
- O modelo é um conjunto de arquivos, chamados de pesos, que o servidor carrega. Qualquer pessoa pode baixar e rodar um modelo de pesos abertos, nos termos da licença desse modelo. O gpt-oss-120b da OpenAI, por exemplo, é publicado sob a licença Apache 2.0, e a OpenAI diz que ele cabe em um único processador gráfico (GPU) de 80 GB, como uma NVIDIA H100
- A busca em documentos permite que o assistente responda com base nas suas próprias políticas e contratos. Os documentos são divididos em trechos e guardados em um índice de busca, e os trechos que correspondem a uma pergunta são passados ao modelo junto com ela. Os engenheiros chamam isso de geração aumentada por recuperação (retrieval-augmented generation), ou RAG
- O login deve passar pelas contas corporativas que os funcionários já usam, para que encerrar a conta de um funcionário também encerre o acesso dele ao assistente
- O histórico de conversas e os logs registram quem perguntou o quê e quando, e o que o assistente respondeu. Os dois são cópias dos seus dados
- As configurações de administração definem quem pode usar qual modelo, em quais coleções de documentos cada grupo pode buscar, se é possível enviar arquivos e por quanto tempo as conversas são guardadas
As licenças passam a importar quando a empresa inteira usa o sistema. O Open WebUI, outro app de chat com código público, vem com login corporativo, grupos de usuários e busca em documentos integrada. Desde a versão 0.6.6 (abril de 2025), a licença dele exige que o nome e o logo do Open WebUI continuem visíveis quando uma implantação tem mais de 50 usuários em um período de 30 dias. Uma licença enterprise elimina essa regra, e uma permissão por escrito do projeto para um contribuidor significativo também. O projeto diz que, por causa dessa cláusula, a licença dele não atenderia aos critérios da Open Source Initiative para ser considerada open source.
“Nossa própria infraestrutura” exclui o ChatGPT Enterprise ou o Microsoft Copilot?
Sim, se “nossa própria” significa servidores que a sua empresa controla, porque a OpenAI opera os servidores por trás do ChatGPT Enterprise e a Microsoft opera os que estão por trás do Copilot. Se o seu time de compliance aceita dados mantidos por um provedor sob contrato, os dois podem continuar na lista. O modelo por trás de um assistente corporativo pode rodar em três lugares, e só o terceiro mantém cada prompt e cada arquivo em servidores que você controla:
- Com o plano empresarial de um provedor, como o ChatGPT Enterprise ou o Microsoft Copilot, o provedor opera os servidores e os seus dados ficam cobertos pelo contrato dele. A documentação do ChatGPT da OpenAI, lida em outubro de 2026, descreve a residência de dados e a residência de inferência para workspaces Enterprise. Elas vinculam a uma região escolhida o lugar onde os dados são armazenados e onde o modelo roda, e a documentação diz que as duas “se aplicam apenas a conteúdo elegível e a cargas de trabalho compatíveis”. Ela acrescenta que “alguns processamentos ou índices sincronizados podem seguir regras de localização separadas”
- Os provedores de nuvem também vendem serviços de modelos, como o Azure OpenAI e o Amazon Bedrock, que rodam o modelo nos data centers do provedor. O seu app de chat pode ficar na sua própria conta de nuvem, mas cada pergunta, com os trechos de documentos anexados a ela, vai para esse serviço
- Um modelo de pesos abertos pode rodar em servidores que você opera, no seu próprio data center ou em máquinas virtuais na sua própria conta de nuvem. Prompts, arquivos enviados e logs ficam então em sistemas que você controla, e os servidores e a segurança do modelo passam a ser tarefa sua, ou do time que você contratar
Os artigos sobre adicionar um modelo de linguagem aos seus próprios sistemas e sobre rodar um modelo em um perímetro fechado, ambos com link acima, entram em mais detalhes. Eles comparam o serviço de um provedor, um serviço de nuvem e servidores que você opera. As páginas com link no fim desta página tratam de custo e dos dois serviços de nuvem.
O que separa um teste de um assistente que os seus funcionários usam todos os dias?
Um teste mostra se as pessoas acham as respostas úteis. O uso diário em uma empresa regulada acrescenta seis requisitos, e quem constrói o sistema deve conseguir mostrar cada um deles funcionando antes do lançamento:
- Cada pessoa vê só os documentos que já pode abrir. A Microsoft define essa regra para o próprio assistente, escrevendo que o Copilot “só exibe dados organizacionais para os quais cada usuário tem pelo menos permissão de visualização”. O OWASP Top 10 for LLM Applications, uma lista dos principais riscos de segurança em software de modelos de linguagem, recomenda “armazenamentos de vetores e de embeddings que levem em conta as permissões”. Isso significa que o índice de busca precisa registrar quem pode ler cada trecho
- Os documentos são tratados como entrada não confiável, porque um arquivo pode trazer instruções ocultas. Em um exemplo do OWASP, um currículo tem texto branco sobre fundo branco que manda o sistema recomendar o candidato, e o modelo obedece quando alguém depois pergunta sobre o candidato. O OWASP acrescenta que responder com base nos seus próprios documentos serve para tornar as respostas mais precisas, e pesquisas mostram que isso não protege totalmente contra esse tipo de ataque. Por isso o assistente deve apenas escrever respostas, e qualquer ação em outro sistema, como enviar um e-mail, deve esperar a aprovação de uma pessoa
- Conversas, arquivos enviados e logs ficam nos seus servidores por um prazo definido pelo seu time de compliance. A Microsoft permite que os administradores usem as ferramentas de compliance do Purview para “definir políticas de retenção para os dados relacionados às interações de chat com o Copilot”. Um assistente privado precisa do mesmo controle sobre o banco de dados de conversas, os arquivos enviados, o índice de busca e os logs do servidor do modelo, que podem guardar o texto completo das perguntas. O seu time de compliance deve conseguir ler quem perguntou o quê sem pedir a um engenheiro
- Um conjunto de perguntas suas, cada uma com a resposta correta, é rodado de novo depois de cada mudança. As pessoas que sabem as respostas escrevem as perguntas a partir do trabalho real delas. Mudança, aqui, significa um modelo novo, novas instruções para o modelo ou um grande lote de documentos novos. O artigo sobre pilotos de IA, com link acima, explica como montar esse conjunto
- A capacidade é dimensionada para o horário de pico, porque um teste com um grupo pequeno diz pouco sobre uma manhã em que boa parte do escritório pergunta ao mesmo tempo. O Ollama é uma ferramenta para rodar um modelo em uma única máquina. Em outubro de 2026, a documentação dele indicava como padrão uma requisição por vez para cada modelo, com as requisições seguintes esperando em uma fila. A comparação entre vLLM e Ollama, com link no fim desta página, explica como cada um lida com muitas pessoas perguntando ao mesmo tempo
- Uma pessoa definida é a responsável pelo assistente e pode desligá-lo, ou voltar ao modelo e às configurações anteriores, sem esperar pelo fornecedor. Os funcionários sabem onde reportar uma resposta errada
Quem pode implantar um ChatGPT privado nos nossos próprios servidores?
O seu próprio time de TI, um fornecedor de software ou um time de engenharia podem implantá-lo. Qual deles se encaixa depende de quantas pessoas vão usar o assistente e de com o que ele precisa se conectar.
Para um teste com um grupo pequeno, um time de TI que já opera servidores Linux consegue instalar um app de chat e um servidor de modelo open source e carregar um modelo de pesos abertos. Um modelo menor pode bastar para começar, e a OpenAI diz que o gpt-oss-20b dela roda em 16 GB de memória. Leia todas as licenças antes, incluindo a do app de chat, e limite o teste a documentos que todos do grupo podem ler, para que as permissões ainda não façam diferença.
Um produto pronto, vendido por um fornecedor como software que você instala nos seus próprios servidores, pode servir para um chat simples sobre uma biblioteca de documentos compartilhada. Pergunte a quais dos seus sistemas ele se conecta e quem instala as atualizações dele, e submeta-o às cinco demonstrações da próxima seção, como você faria com um sistema construído sob medida.
Um time de engenharia é necessário quando o assistente precisa funcionar com o login corporativo e as permissões de vários sistemas. O mesmo vale quando ele precisa se conectar a outros sistemas, como um sistema de gestão de documentos, ou manter logs que o seu time de compliance consiga ler. O time pode ser uma empresa externa ou engenheiros que entram no seu time de TI. Combine antes de o trabalho começar quem vai operar o sistema depois do lançamento.
Como avaliar uma empresa que se oferece para implantá-lo?
Antes de assinar, peça cinco demonstrações a cada fornecedor. Sempre que possível, use uma instalação de teste com o login corporativo da sua empresa e documentos que você tem permissão para compartilhar com o fornecedor:
- Faça login como alguém que não pode abrir um determinado documento e pergunte sobre ele. O assistente deve responder como se o documento não existisse. Depois remova o acesso de um colega a um arquivo no sistema de origem e meça quanto tempo o assistente leva para parar de usá-lo com esse colega
- Peça ao fornecedor que mostre onde as conversas, os arquivos enviados e os logs ficam armazenados e que exclua o histórico de uma pessoa enquanto você assiste. Depois descubra o que permanece em backups e logs, e quando isso é removido
- Veja o conjunto de perguntas de teste que o fornecedor roda de novo depois de uma atualização do modelo e o registro da última execução, e descubra quem escreveu as respostas corretas
- Pergunte para quantas pessoas simultâneas o sistema foi dimensionado e veja o teste de carga por trás desse número. O teste deve usar perguntas e documentos parecidos com os seus, com o número de usuários que você espera no seu horário de pico
- Verifique se você conseguiria operar o sistema sem o fornecedor. O código, a configuração, os arquivos do modelo, as perguntas de teste e as instruções de operação devem ser todos entregues, e nada deve depender dos servidores ou das chaves de licença do fornecedor
Onde a amBrain se encaixa?
Sobre o próprio trabalho com modelos de linguagem, a amBrain diz: “Levamos à produção uma integração de LLM dentro do perímetro de FinTech de um cliente: extração e normalização de avisos não estruturados de corretoras e de venues — eventos corporativos, alterações de instrumentos e de margem — em registros estruturados que o sistema de trading consome.” O cliente não é nomeado, e nenhum número sobre o projeto é publicado.
Este artigo não é um estudo de caso. Ele não diz onde o modelo rodou nesse projeto e não afirma que a amBrain tenha construído um ChatGPT privado, um assistente para funcionários ou uma busca em documentos para qualquer cliente. Ele não traz preços nem prazos.
A amBrain constrói software desde 2019. A amBrain trabalha em três formatos: entrega completa, time dedicado ou engenheiros embarcados no seu time. O cliente mantém a propriedade integral do produto e do código, exceto dos componentes reutilizáveis da amBrain.
Escreva uma página dizendo qual dos três casos acima se aplica a você. Para cada um dos seis requisitos, acrescente o que ele significa na sua empresa, como quais sistemas guardam as permissões de documentos e por quanto tempo as conversas precisam ser mantidas. Envie essa página para a amBrain, ou para qualquer outro time da sua lista, e peça a todos os times as mesmas cinco demonstrações.
Perguntas comuns
- Ele vai ser tão bom quanto o ChatGPT? Ninguém consegue dizer antes de testá-lo no seu próprio trabalho. Rode o seu conjunto de perguntas em cada modelo que você está considerando e peça às pessoas que sabem as respostas que avaliem os resultados. Para comparar com um serviço público, use perguntas que não contenham dados de clientes
- Podemos começar com o modelo de um provedor e passar para os nossos próprios servidores depois? Sim, se o seu app de chat acessa o modelo pela API compatível com a OpenAI. Até a mudança, envie ao provedor só os dados que o seu time de compliance permite que saiam da empresa. O vLLM implementa a mesma API de chat, então o app passa a precisar só do endereço do seu servidor e do nome do modelo, desde que não use nenhum recurso que só o serviço do provedor oferece. Rode as suas perguntas de novo antes de os funcionários migrarem, porque as respostas mudam com o modelo, e pergunte ao provedor como os dados já enviados a ele serão excluídos
- Os funcionários podem enviar os próprios arquivos? Sim. Um arquivo enviado é uma cópia do arquivo, guardada pelo app de chat e às vezes adicionada ao índice de busca. Ele precisa do mesmo prazo de retenção das conversas e tem que ser excluído junto com elas. Decida se um arquivo enviado fica só nas conversas de quem o enviou ou se pode ser compartilhado com um grupo