Une entreprise peut faire tourner un grand modèle de langage sur des serveurs qu'elle contrôle et le connecter à ses tickets de support, à ses documents et à ses outils internes, sans que ces données sortent de chez elle. Cet article explique, en termes simples, quelles tâches s'y prêtent, où le modèle peut tourner, ce qu'il faut décider avant d'engager qui que ce soit, à quels types de coûts s'attendre, pourquoi les pilotes restent bloqués avant la production et comment vérifier une entreprise qui propose de le construire.
Oui, une entreprise peut utiliser l'IA sur ses tickets de support, ses documents et ses outils internes sans que ces données quittent ses propres serveurs. Un grand modèle de langage, ou LLM, est le type d'IA qui fait fonctionner les assistants conversationnels. Certains de ces modèles peuvent être téléchargés et exécutés sur des serveurs que l'entreprise contrôle, dans ses propres locaux ou dans son propre compte cloud, puis connectés aux systèmes que les équipes utilisent déjà.
Le modèle est la plus petite partie du travail. Ce qui décide si le système entre dans l'usage quotidien, c'est le choix de la tâche, une description écrite d'une réponse correcte, et une personne nommément désignée qui vérifie les réponses et exploite le système après le lancement. La dernière partie de cet article montre comment vérifier une entreprise qui propose de le construire.
La réponse courte : faites tourner un modèle à poids ouverts sur des serveurs que vous contrôlez et connectez-le d'abord à une tâche dans un système, comme le tri des tickets de support ou la lecture des documents entrants. Avant d'engager qui que ce soit, écrivez quelles données le modèle peut voir, à quoi ressemble une réponse correcte, qui vérifie les réponses au début et qui exploite le système après le lancement. Engagez ensuite un prestataire qui pose des questions sur ces réponses avant de recommander un modèle.
À lire aussi
« L'IA sur nos propres serveurs » signifie que le modèle tourne sur du matériel que votre entreprise contrôle, et qu'aucun texte n'est envoyé à une entreprise d'IA extérieure. Votre ticket, votre document ou votre question va de votre système au modèle et revient, sans jamais quitter votre réseau ni votre compte cloud.
C'est possible grâce aux modèles à poids ouverts. Un modèle à poids ouverts est un modèle dont le développeur publie les fichiers, de sorte que n'importe qui peut les télécharger et faire tourner le modèle selon sa licence. Les services d'IA que vous utilisez dans un navigateur fonctionnent autrement : votre texte part vers les serveurs du fournisseur et y est traité.
Garder les données en interne ne concerne pas que le modèle. Le système conserve aussi des logs, un index de recherche de vos documents, les exemples sur lesquels il est testé et les écrans où des personnes vérifient ses réponses. Chacun de ces éléments contient des copies de vos données, et chacun doit lui aussi rester sur vos serveurs.
Un LLM est utile là où, aujourd'hui, des personnes lisent du texte puis remplissent, trient ou rédigent quelque chose. Tâches typiques dans une entreprise :
Certains travaux conviennent mal à un LLM, et mieux vaut le savoir avant que le projet ne commence :
Un test simple pour n'importe quelle tâche : elle convient à un LLM quand une personne l'accomplit aujourd'hui en lisant du texte, que le résultat correct peut être écrit noir sur blanc et qu'un résultat faux peut être intercepté avant de causer du tort.
Oui. Le choix porte sur l'endroit où tourne le modèle, et seuls deux des trois dispositifs courants gardent les données sur des serveurs que vous contrôlez :
Une entreprise peut utiliser plus d'un dispositif. Les documents publics peuvent aller au service d'un fournisseur, tandis que les dossiers clients restent sur un modèle que vous exploitez. La règle qui envoie chaque type de données à sa place doit alors être écrite et appliquée. Un article précédent de ce blog, sur l'exploitation d'un LLM dans un périmètre fermé, compare ces options plus en détail.
Qu'un modèle que vous pouvez exploiter vous-même soit assez bon se mesure sur vos propres documents et tickets, et ne se lit pas dans un classement public. Beaucoup de tâches internes sont étroites, comme lire un seul type de formulaire ou répartir des tickets entre une liste connue d'équipes, et un test sur de vrais exemples tirés de votre travail répond à la question.
Les modèles à poids ouverts sont proposés sous des licences différentes, il faut donc que quelqu'un lise la licence du modèle que vous choisissez. Les modèles Qwen3 sortis par Alibaba en 2025 et les modèles gpt-oss d'OpenAI sont publiés sous licence Apache 2.0, tandis que le plus grand modèle ouvert de la version ultérieure Qwen3.8 est accompagné de sa propre licence Qwen3.8-Max. Llama 3.3 de Meta est proposé sous la licence communautaire propre à Meta, qui ajoute des conditions, dont le respect de la politique d'utilisation acceptable de Meta.
Un LLM ne remplace pas vos systèmes. Il se place entre eux : il lit du texte à un endroit et dépose un résultat à un autre. L'ajouter à un système interne revient à répondre à quatre questions simples :
Commencez par une tâche dans un système. Au début, le modèle propose et une personne décide. Le modèle n'est autorisé à agir seul que sur les parties où il continue d'avoir raison sur du travail réel, et la méthode manuelle reste en solution de repli.
Les personnes qui font le travail aujourd'hui devraient façonner le système. Elles savent quels documents sont difficiles, quelles réponses sont fausses et où une erreur coûte de l'argent. Ce sont aussi elles qui vérifieront les réponses pendant les premiers mois, donc leur temps doit figurer dans le plan.
Avant que quiconque construise un système d'IA pour vous, répondez par écrit à sept questions. Aucune ne demande de formation d'ingénieur, et chaque réponse change ce qu'il faut construire :
Les réponses écrites à ces sept questions constituent votre cahier des charges. Remises à trois prestataires, elles produisent trois propositions que vous pouvez comparer. Sans elles, vous recevez trois démonstrations d'une fenêtre de chat.
Une démo répond à une seule question : le modèle sait-il faire la tâche sur de bons exemples ? L'usage quotidien en ajoute quatre autres, et un pilote qui reste bloqué les a généralement sautées :
Terminer un pilote bloqué consiste généralement à construire ces quatre éléments autour du modèle, et non à acheter un meilleur modèle. Un article précédent de ce blog, sur le pilote d'IA qui n'est jamais passé en production, explique chacun d'eux plus en profondeur.
Tout prestataire qui reprend un pilote bloqué a besoin de trois choses de votre part : les exemples du pilote, les documents sur lesquels il a échoué, et le nom de la personne qui sera responsable du système. Un prestataire qui ne demande rien de tout cela prépare une nouvelle démo.
Cet article ne donne aucun prix. « Un système d'IA sur nos propres serveurs » recouvre des projets dont la taille peut être plusieurs fois supérieure d'un projet à l'autre, et un chiffre annoncé avant que quiconque ait entendu vos réponses aux sept questions ci-dessus est un chiffre commercial, pas une estimation.
Ce qui est utile, c'est de connaître les types de coûts, car la plupart dépendent de décisions que vous maîtrisez :
Le coût suit une logique différente de celle du service d'un fournisseur. Un fournisseur facture la quantité de texte que le modèle lit et écrit. Des serveurs que vous possédez, ou que vous louez au mois, coûtent à peu près la même chose qu'ils soient occupés ou inactifs ; c'est donc le volume de travail qui décide quel dispositif vous coûte le moins.
L'étendue du projet est la part du coût que vous maîtrisez le plus directement. Une tâche, dans un système, pour une équipe : c'est la plus petite première version qui montre encore si le système vaut la peine d'être étendu.
Quatre types de prestataires répondent quand une entreprise dit « nous voulons de l'IA sur nos propres serveurs » :
Avant toute chose, demandez à tout prestataire ces preuves :
Écoutez ensuite ce que le prestataire vous demande. Une entreprise qui a déjà construit ce type de système pose ces questions avant de chiffrer :
Un test rapide pour tout prestataire d'IA : demandez ce qu'il advient d'un document ou d'un ticket que le modèle traite mal. Un prestataire qui a déjà construit ce type de système répond en disant où va la mauvaise réponse et qui la corrige. Un prestataire qui ne l'a pas fait répond par le nom d'un modèle.
Parmi les types de prestataires décrits ci-dessus, amBrain est une société d'ingénierie.
Ce qu'amBrain peut dire publiquement de son propre travail avec les modèles de langage, en intégralité : Nous avons mené une intégration LLM jusqu'en production dans le périmètre FinTech d'un client : extraction et normalisation d'avis non structurés émis par des brokers et des places de marché — opérations sur titres, modifications d'instruments et de marges — en enregistrements structurés que consomme le système de trading.
Le client n'est pas nommé, l'endroit où le modèle a tourné dans ce projet n'est pas divulgué, et aucun chiffre sur ce projet n'est donné. Cet article n'en est pas une étude de cas. Il explique comment planifier et choisir, et il n'affirme pas qu'amBrain a construit un système de tickets de support, un assistant pour les équipes ou tout autre système d'IA interne que l'extraction d'avis mentionnée ci-dessus.
Au-delà de cette intégration : amBrain construit des logiciels depuis 2019. Nous travaillons en trois formats : livraison complète, équipe dédiée ou ingénieurs intégrés à votre équipe. Le client conserve la pleine propriété du produit et du code, à l'exception de nos composants réutilisables.
Si vous en êtes au début, l'étape suivante utile n'est pas la recherche d'un fournisseur. C'est une page avec les réponses écrites aux sept questions de cet article. Donnez la même page à chaque prestataire avec qui vous discutez, nous ou n'importe qui d'autre, et leurs propositions pourront être comparées ligne par ligne.
Apportez votre architecture actuelle et le mode de défaillance qui vous inquiète : nous les passerons en revue ensemble en une demi-heure.