amBrain
FinTechOct 1, 2026Lecture 10 min

Un ChatGPT privé pour votre entreprise, sur vos propres serveurs : ce que cela demande et qui peut le mettre en place

ChatGPT privéIA sur vos propres serveursDu pilote à la productionQui la construit
Erreur de chargement de l'image

Vous pouvez offrir à vos équipes un assistant de type ChatGPT sans que les données clients quittent l'entreprise. Avant l'usage quotidien, celui qui le met en place doit vous montrer que l'assistant respecte les droits d'accès de chaque personne aux documents et conserve les conversations et les logs aussi longtemps que votre équipe conformité le décide.

Un ChatGPT privé est un assistant conversationnel qui fonctionne comme ChatGPT, mais qui tourne sur des serveurs que votre entreprise contrôle. Les collaborateurs se connectent à une application de chat qui envoie leurs questions à un modèle de langage installé sur ces serveurs, et une recherche dans vos propres documents permet au modèle d'y puiser ses réponses. Chacune de ces briques existe aujourd'hui sous forme de logiciel open source ou sous licence.

Le travail consiste à relier ces briques à l'authentification de votre entreprise, aux droits d'accès aux documents et aux logs, puis à exploiter le système. Votre équipe informatique peut mettre en place un essai. Avant que chaque salarié s'appuie dessus, une entreprise réglementée devrait engager une équipe capable de montrer chacune des exigences ci-dessous en fonctionnement sur les propres systèmes de l'entreprise.

La réponse courte : votre équipe informatique peut mener un essai sur des documents que tous les membres du groupe d'essai ont le droit de lire. Pour un usage quotidien dans toute l'entreprise, n'engagez une équipe qu'après qu'elle vous a montré l'assistant en fonctionnement avec votre propre authentification et vos propres documents. L'assistant doit masquer les documents qu'une personne ne peut pas ouvrir et conserver les conversations et les logs sur vos serveurs pendant une durée fixée par votre équipe conformité.

Pourquoi les entreprises veulent-elles un ChatGPT privé ?

Les salariés n'attendent pas que leur employeur leur fournisse des outils d'IA. Dans le Work Trend Index 2024 de Microsoft et LinkedIn, une enquête menée auprès de 31 000 travailleurs du savoir dans 31 pays, 78 % des utilisateurs de l'IA déclaraient apporter leurs propres outils d'IA au travail.

En mai 2023, Samsung a temporairement restreint les outils d'IA générative sur les appareils de l'entreprise et ses réseaux internes, après que des données internes ont été divulguées par accident à ChatGPT en avril. TechCrunch a rapporté l'inquiétude de Samsung : des données stockées sur des serveurs extérieurs sont difficiles à « récupérer et supprimer ». L'entreprise a indiqué qu'elle « étudiait des mesures pour créer un environnement sécurisé permettant d'utiliser l'IA générative en toute sécurité ».

Dans une enquête auprès des entreprises financières britanniques, publiée par la Banque d'Angleterre et la FCA en novembre 2024, la protection des données et de la vie privée constituait la principale contrainte réglementaire perçue pesant sur l'usage de l'IA.

De quoi se compose un ChatGPT privé ?

« ChatGPT privé » n'est pas le nom d'un produit d'OpenAI. L'expression désigne un système assemblé à partir de briques distinctes, dont un modèle d'OpenAI, l'entreprise à l'origine de ChatGPT, peut faire partie. Les projets open source cités ci-dessous sont des exemples que vous pourrez croiser dans des propositions, et cet article ne les classe pas. Voici ces briques :

  • L'application de chat est la page web où les collaborateurs se connectent, posent leurs questions, importent des fichiers et retrouvent leurs conversations passées. LibreChat en est un exemple open source, sous licence MIT. Sa page de projet mentionne l'authentification d'entreprise via OAuth2 et LDAP, deux façons courantes de relier une application aux comptes que les collaborateurs possèdent déjà. Elle fonctionne aussi avec tout serveur de modèle qui accepte les requêtes au format du service d'OpenAI lui-même, ce qu'on appelle une API compatible OpenAI
  • Le serveur de modèle fait tourner le modèle de langage sur votre matériel et répond aux requêtes de l'application de chat. vLLM en est un exemple open source. Sa documentation indique qu'il « implémente les API Completions et Chat d'OpenAI, et plus encore » : une application de chat écrite pour le service d'OpenAI peut donc envoyer ses questions à votre serveur à la place
  • Le modèle est un ensemble de fichiers, appelés poids, que le serveur charge. N'importe qui peut télécharger et faire tourner un modèle à poids ouverts, selon les conditions de sa licence. Le modèle gpt-oss-120b d'OpenAI, par exemple, est publié sous licence Apache 2.0, et OpenAI indique qu'il tient sur un seul processeur graphique (GPU) de 80 Go, comme un NVIDIA H100
  • La recherche documentaire permet à l'assistant de répondre à partir de vos propres politiques internes et contrats. Les documents sont découpés en passages et conservés dans un index de recherche, et les passages qui correspondent à une question sont transmis au modèle en même temps qu'elle. Les ingénieurs appellent cela la génération augmentée par récupération (retrieval-augmented generation), ou RAG
  • La connexion doit passer par les comptes d'entreprise que les collaborateurs utilisent déjà, pour que la fermeture du compte d'un salarié mette aussi fin à son accès à l'assistant
  • L'historique des conversations et les logs enregistrent qui a demandé quoi et quand, et ce que l'assistant a répondu. Les deux sont des copies de vos données
  • Les paramètres d'administration déterminent qui peut utiliser quel modèle, dans quelles collections de documents chaque groupe peut chercher, si l'import de fichiers est autorisé et combien de temps les conversations sont conservées

Les licences comptent dès que toute l'entreprise utilise le système. Open WebUI, une autre application de chat dont le code est public, intègre l'authentification d'entreprise, des groupes d'utilisateurs et une recherche documentaire. Depuis la version 0.6.6 (avril 2025), sa licence exige que le nom et le logo Open WebUI restent visibles dès qu'un déploiement compte plus de 50 utilisateurs sur une période de 30 jours. Une licence entreprise lève cette règle, tout comme une autorisation écrite du projet accordée à un contributeur important. Le projet indique qu'en raison de cette clause, sa licence ne répondrait pas aux critères de l'Open Source Initiative pour l'open source.

« Notre propre infrastructure » exclut-elle ChatGPT Enterprise ou Microsoft Copilot ?

Oui, si « notre propre infrastructure » désigne des serveurs que votre entreprise contrôle, car c'est OpenAI qui exploite les serveurs de ChatGPT Enterprise, et Microsoft ceux de Copilot. Si votre équipe conformité accepte que des données soient détenues par un fournisseur dans le cadre d'un contrat, les deux peuvent rester sur la liste. Le modèle qui fait fonctionner un assistant d'entreprise peut tourner à trois endroits, et seul le troisième garde chaque prompt et chaque fichier sur des serveurs que vous contrôlez :

  • Avec l'offre professionnelle d'un fournisseur, comme ChatGPT Enterprise ou Microsoft Copilot, c'est le fournisseur qui exploite les serveurs, et vos données sont couvertes par son contrat. La documentation de ChatGPT d'OpenAI, consultée en octobre 2026, décrit la résidence des données et la résidence de l'inférence pour les espaces de travail Enterprise. Elles rattachent à une région choisie le lieu de stockage des données et le lieu d'exécution du modèle, et la documentation précise que l'une comme l'autre « ne s'appliquent qu'aux contenus éligibles et aux charges de travail prises en charge ». Elle ajoute que « certains traitements ou index synchronisés peuvent suivre des règles de localisation distinctes »
  • Les fournisseurs cloud vendent aussi des services de modèles, comme Azure OpenAI et Amazon Bedrock, qui font tourner le modèle dans les centres de données du fournisseur. Votre application de chat peut résider dans votre propre compte cloud, mais chaque question, avec les passages de documents qui l'accompagnent, part vers ce service
  • Un modèle à poids ouverts peut tourner sur des serveurs que vous exploitez, dans votre propre centre de données ou sur des machines virtuelles de votre propre compte cloud. Les prompts, les fichiers importés et les logs restent alors sur des systèmes que vous contrôlez, et les serveurs comme la sécurité du modèle deviennent votre affaire, ou celle de l'équipe que vous engagez

Les articles sur l'ajout d'un modèle de langage à vos propres systèmes et sur son exploitation dans un périmètre fermé, dont les liens figurent plus haut, entrent davantage dans le détail. Ils comparent le service d'un fournisseur, un service cloud et des serveurs que vous exploitez. Les pages dont les liens figurent au bas de cette page traitent du coût et des deux services cloud.

Qu'est-ce qui sépare un essai d'un assistant que vos équipes utilisent tous les jours ?

Un essai montre si les gens trouvent les réponses utiles. L'usage quotidien dans une entreprise réglementée ajoute six exigences, et le prestataire qui construit le système doit pouvoir montrer chacune d'elles en fonctionnement avant le lancement :

  • Chaque personne ne voit que les documents qu'elle peut déjà ouvrir. Microsoft applique cette règle à son propre assistant, en écrivant que Copilot « ne fait remonter que les données de l'organisation pour lesquelles chaque utilisateur dispose au moins d'une autorisation d'affichage ». L'OWASP Top 10 for LLM Applications, une liste des principaux risques de sécurité des logiciels à base de modèles de langage, recommande des « bases vectorielles et d'embeddings tenant compte des autorisations ». Autrement dit, l'index de recherche doit enregistrer qui a le droit de lire chaque passage
  • Les documents sont traités comme des entrées non fiables, car un fichier peut contenir des instructions cachées. Dans un exemple de l'OWASP, un CV comporte un texte blanc sur fond blanc qui demande au système de recommander le candidat, et le modèle obéit lorsque quelqu'un l'interroge plus tard sur ce candidat. L'OWASP ajoute que répondre à partir de vos propres documents vise à rendre les réponses plus exactes, et que des travaux de recherche montrent que cela ne protège pas complètement contre de telles attaques. L'assistant doit donc se limiter à rédiger des réponses, et toute action dans un autre système, comme l'envoi d'un e-mail, doit attendre l'approbation d'une personne
  • Les conversations, les fichiers importés et les logs restent sur vos serveurs pendant une durée fixée par votre équipe conformité. Microsoft permet aux administrateurs d'utiliser ses outils de conformité Purview pour « définir des stratégies de rétention pour les données liées aux interactions de chat avec Copilot ». Un assistant privé a besoin du même contrôle sur la base de données des conversations, les fichiers importés, l'index de recherche et les logs du serveur de modèle, qui peuvent contenir le texte intégral des questions. Votre équipe conformité doit pouvoir consulter qui a demandé quoi sans avoir à solliciter un ingénieur
  • Un jeu de questions propres à votre entreprise, chacune assortie de sa réponse correcte, est relancé après chaque changement. Les personnes qui connaissent les réponses rédigent les questions à partir de leur travail réel. Par changement, on entend ici un nouveau modèle, de nouvelles instructions données au modèle ou un gros lot de nouveaux documents. L'article sur le pilote, dont le lien figure plus haut, explique comment constituer un tel jeu
  • La capacité est dimensionnée pour l'heure la plus chargée, car un essai avec un petit groupe en dit peu sur une matinée où une grande partie du bureau pose ses questions en même temps. Ollama est un outil qui permet de faire tourner un modèle sur une seule machine. En octobre 2026, sa documentation fixait par défaut une seule requête à la fois pour chaque modèle, les requêtes suivantes attendant dans une file. La comparaison entre vLLM et Ollama, dont le lien figure au bas de cette page, explique comment chacun gère de nombreuses personnes qui posent leurs questions en même temps
  • Une personne nommément désignée est responsable de l'assistant et peut le couper, ou revenir au modèle et aux paramètres précédents, sans attendre le prestataire. Les collaborateurs savent où signaler une mauvaise réponse

Qui peut mettre en place un ChatGPT privé sur nos propres serveurs ?

Votre propre équipe informatique, un éditeur ou une équipe d'ingénierie peut le mettre en place. Le bon choix dépend du nombre de personnes qui utiliseront l'assistant et de ce à quoi il doit se connecter.

Pour un essai avec un petit groupe, une équipe informatique qui exploite déjà des serveurs Linux peut installer une application de chat et un serveur de modèle open source, puis charger un modèle à poids ouverts. Un modèle plus petit peut suffire pour commencer, et OpenAI indique que son gpt-oss-20b tient dans 16 Go de mémoire. Lisez d'abord chaque licence, y compris celle de l'application de chat, et limitez l'essai à des documents que tout le groupe a le droit de lire, pour que les droits d'accès ne comptent pas encore.

Un produit prêt à l'emploi, vendu par un éditeur sous forme de logiciel à installer sur vos propres serveurs, peut convenir à un simple chat sur une bibliothèque de documents partagée. Demandez à quels systèmes de votre entreprise il se connecte et qui installe ses mises à jour, et soumettez-le aux cinq démonstrations de la section suivante, comme vous le feriez pour un développement sur mesure.

Une équipe d'ingénierie devient nécessaire quand l'assistant doit fonctionner avec l'authentification de votre entreprise et les droits d'accès de plusieurs systèmes. Il en va de même quand il doit se connecter à d'autres systèmes, comme un système de gestion documentaire, ou tenir des logs que votre équipe conformité peut lire. Cette équipe peut être une société extérieure ou des ingénieurs qui rejoignent votre équipe informatique. Convenez avant le début du travail de qui exploitera le système après le lancement.

Comment vérifier une entreprise qui propose de le mettre en place ?

Avant de signer, demandez cinq démonstrations à chaque prestataire. Dans la mesure du possible, utilisez une installation de test avec l'authentification de votre propre entreprise et des documents que vous avez le droit de partager avec le prestataire :

  • Connectez-vous en tant que personne qui n'a pas le droit d'ouvrir un document donné, et posez une question à son sujet. L'assistant doit répondre comme si le document n'existait pas. Retirez ensuite à un collègue l'accès à un fichier dans le système d'origine, et chronométrez le temps que met l'assistant à cesser de l'utiliser pour ce collègue
  • Demandez au prestataire de montrer où sont stockés les conversations, les fichiers importés et les logs, et de supprimer l'historique d'une personne sous vos yeux. Renseignez-vous ensuite sur ce qui subsiste dans les sauvegardes et les logs, et sur le moment où c'est supprimé
  • Examinez le jeu de questions de test que le prestataire relance après une mise à jour du modèle, ainsi que le compte rendu de sa dernière exécution, et demandez qui a rédigé les réponses correctes
  • Demandez pour combien de personnes simultanées le système a été dimensionné, et faites-vous montrer le test de charge qui étaye ce chiffre. Le test doit utiliser des questions et des documents semblables aux vôtres, avec le nombre d'utilisateurs que vous attendez à votre heure la plus chargée
  • Vérifiez que vous pourriez exploiter le système sans le prestataire. Le code, la configuration, les fichiers du modèle, les questions de test et les instructions d'exploitation doivent tous vous être remis, et rien ne doit dépendre des serveurs ni des clés de licence du prestataire

Où se situe amBrain ?

Sur son propre travail avec les modèles de langage, amBrain dit : « Nous avons mené une intégration LLM jusqu'en production dans le périmètre FinTech d'un client : extraction et normalisation d'avis non structurés émis par des brokers et des places de marché — opérations sur titres, modifications d'instruments et de marges — en enregistrements structurés que consomme le système de trading. » Le client n'est pas nommé, et aucun chiffre sur le projet n'est publié.

Cet article n'est pas une étude de cas. Il ne dit pas où le modèle a tourné dans ce projet, et il n'affirme pas qu'amBrain a construit un ChatGPT privé, un assistant pour les équipes ou une recherche documentaire pour quelque client que ce soit. Il ne donne ni prix ni délais.

amBrain développe des logiciels depuis 2019. amBrain travaille en trois formats : la prestation complète, une équipe dédiée ou des ingénieurs intégrés à votre équipe. Le client conserve la pleine propriété du produit et du code, à l'exception des composants réutilisables d'amBrain.

Rédigez une page qui indique lequel des trois cas ci-dessus est le vôtre. Pour chacune des six exigences, précisez ce qu'elle signifie dans votre entreprise, par exemple quels systèmes détiennent les droits d'accès aux documents et combien de temps les conversations doivent être conservées. Envoyez cette page à amBrain, ou à toute autre équipe de votre liste, et demandez à chaque équipe les cinq mêmes démonstrations.

Questions fréquentes

  • Sera-t-il aussi bon que ChatGPT ? Personne ne peut le dire avant de l'avoir testé sur votre propre travail. Soumettez votre jeu de questions à chaque modèle envisagé, et faites noter les résultats par les personnes qui connaissent les réponses. Pour comparer avec un service accessible au public, utilisez des questions qui ne contiennent aucune donnée client
  • Pouvons-nous commencer avec le modèle d'un fournisseur et passer plus tard sur nos propres serveurs ? Oui, si votre application de chat accède au modèle via l'API compatible OpenAI. Jusqu'à la migration, n'envoyez au fournisseur que des données que votre équipe conformité autorise à sortir de l'entreprise. vLLM implémente la même API de chat : l'application n'a alors besoin que de l'adresse de votre serveur et du nom du modèle, à condition qu'elle n'utilise aucune fonctionnalité propre au service du fournisseur. Relancez vos questions avant que les collaborateurs ne basculent, car les réponses changent avec le modèle, et demandez au fournisseur comment les données qui lui ont déjà été envoyées seront supprimées
  • Les collaborateurs peuvent-ils importer leurs propres fichiers ? Oui. Un fichier importé est une copie, conservée par l'application de chat et parfois ajoutée à l'index de recherche. Il lui faut la même durée de conservation que les conversations, et il doit être supprimé avec elles. Décidez si un fichier importé reste dans les conversations de la personne qui l'a importé ou s'il peut être partagé avec un groupe

Vous avez une architecture de ce type sur la table ?

Apportez votre architecture actuelle et le mode de défaillance qui vous inquiète : nous les passerons en revue ensemble en une demi-heure.