Une entreprise réglementée dont les documents ne peuvent pas quitter son périmètre dispose malgré tout de trois façons de faire tourner un modèle de langage : l'API hébergée du fournisseur encadrée par des contrôles contractuels, le service de modèles managé de sa plateforme cloud, ou un modèle à poids ouverts sur une infrastructure qu'elle exploite. Chaque option fait peser un coût différent sur l'entreprise : contrats et approbations, capacité dans la bonne région, ou serveurs et astreinte. Voici ce que coûte chacune en exploitation, en preuves de conformité, en latence et en effectifs, et quelles questions montrent si un prestataire d'ingénierie l'a mise en œuvre dans le périmètre d'un client.
L'exigence est formulée en une seule phrase : les documents ne doivent pas quitter le périmètre. La décision d'architecture s'y cache, car le périmètre peut être tracé à trois endroits, et chaque endroit fait peser un coût différent sur l'entreprise qui le trace.
L'API hébergée d'un fournisseur de modèles inscrit le périmètre dans un contrat avec ce fournisseur. Le service de modèles managé d'une plateforme cloud l'inscrit dans le contrat cloud. Un modèle à poids ouverts sur des serveurs que vous exploitez le maintient dans votre propre réseau, et vous confie toutes les tâches que le fournisseur assumerait autrement.
La réponse courte : il ne s'agit pas de choisir entre ce qui est sûr et ce qui ne l'est pas, mais de décider qui assume quel travail. Une API hébergée ne demande aucune infrastructure en propre pour démarrer et vous lie aux conditions de conservation, aux limites de débit et au calendrier de retrait du fournisseur. Un service de modèles managé peut tenir les prompts hors de portée du développeur du modèle, pour les modèles que le cloud vend et exploite lui-même, et fait entrer les régions, les types de déploiement et la capacité réservée dans la conception. Un modèle à poids ouverts auto-hébergé garde l'inférence sur une infrastructure que vous contrôlez et met à votre charge les licences, la capacité d'accélérateurs, la sécurité du serving et l'astreinte. Ce qu'amBrain peut étayer publiquement sur son propre travail autour des LLM, en intégralité : Nous avons mené une intégration LLM jusqu'en production dans le périmètre FinTech d'un client : extraction et normalisation d'avis non structurés émis par des brokers et des places de marché — opérations sur titres, modifications d'instruments et de marges — en enregistrements structurés que consomme le système de trading. Le client n'est pas nommé, l'option retenue pour ce projet parmi celles décrites ci-dessous n'est pas divulguée, et cet article n'est pas une étude de cas de ce projet.
« Ne peut pas quitter le périmètre » ne signifie pas la même chose pour un responsable des risques, un délégué à la protection des données et une équipe infrastructure. Formulée sous forme de questions, cette contrainte devient une exigence à laquelle chaque option peut être confrontée :
Les réponses peuvent varier selon la classe de données. Un avis réglementaire déjà public et la pièce d'identité d'un client n'ont pas besoin du même périmètre, et un pipeline peut les router différemment.
Ici, ce sont le contrat et la documentation du fournisseur qui définissent le périmètre, et ils se lisent donc ligne par ligne. La documentation d'OpenAI sur les données de l'API indique que, depuis le 1er mars 2023, les données envoyées à l'API ne sont pas utilisées pour entraîner ou améliorer ses modèles, sauf si le client y consent explicitement (opt-in). La même page indique que les logs de surveillance des abus, qui peuvent contenir des prompts et des réponses, sont générés par défaut et conservés jusqu'à 30 jours, sauf si une conservation plus longue est exigée par la loi ou raisonnablement nécessaire pour protéger le service ou des tiers contre un préjudice.
Les deux limites peuvent être restreintes, et chaque restriction relève d'une approbation, pas d'un paramètre :
Le modèle suit lui aussi le calendrier du fournisseur. La page des dépréciations d'OpenAI indique des préavis minimaux avant retrait, sauf si des enjeux de sûreté ou de conformité imposent un délai plus court : au moins 6 mois pour un modèle en disponibilité générale, au moins 3 mois pour ses variantes spécialisées, et un préavis bien plus court, par exemple 2 semaines, pour les modèles en préversion. Chaque retrait implique de noter le modèle de remplacement sur vos propres documents avant la date, si bien que la migration est un travail planifié récurrent et non un incident.
Les plateformes cloud mettent à disposition des modèles de plusieurs développeurs, certains dans le cadre du contrat cloud qu'une entreprise détient peut-être déjà. La documentation de Microsoft sur les modèles vendus par Azure dans Microsoft Foundry indique que les prompts, les complétions et les embeddings ne sont pas accessibles à OpenAI ni aux autres fournisseurs de ces modèles. Le même catalogue propose des modèles que Microsoft ne vend pas : pour les modèles Claude dans Microsoft Foundry, sa documentation désigne Anthropic comme vendeur, opérateur et sous-traitant de données indépendant pour les prompts et les sorties, et une option d'hébergement les traite sur l'infrastructure d'Anthropic, éventuellement en dehors de la région Azure sélectionnée.
La documentation d'Amazon Bedrock décrit un compte de déploiement de modèles par fournisseur de modèles dans chaque région, détenu et exploité par l'équipe du service Bedrock, auquel les fournisseurs de modèles n'ont pas accès, de sorte qu'ils ne voient pas les prompts et les complétions des clients.
Le modèle tourne malgré tout sur une infrastructure exploitée par le cloud, et non dans votre propre réseau. Pour certains périmètres, cela compte comme étant à l'intérieur ; pour d'autres, seule la troisième option l'est. Quand c'est le cas, le périmètre dépend de choix effectués dans le tenant, et la documentation en détaille les conséquences :
Pour une entité financière de l'UE relevant du champ d'application de DORA, le contrat cloud constitue déjà un accord avec un prestataire tiers de services TIC. Le 18 novembre 2025, les autorités européennes de surveillance ont publié la liste des prestataires tiers critiques de services TIC soumis à une supervision au niveau de l'Union, et elle comprend Amazon Web Services EMEA, Google Cloud EMEA et Microsoft Ireland Operations. L'Autorité bancaire européenne rappelle que DORA est entré en application le 17 janvier 2025 et que les entités relevant de son champ d'application doivent tenir un registre de leurs accords contractuels avec des prestataires tiers de services TIC. Un fournisseur de modèles avec lequel l'entité n'a pas encore contracté, ou un nouveau service relevant d'un contrat cloud qu'elle détient déjà, est donc une question qui concerne ce registre, et pas seulement l'architecture.
L'auto-hébergement, sur site ou sur des machines virtuelles dans votre propre compte cloud, ramène l'inférence à l'intérieur, avec toutes les tâches qu'assumait le fournisseur. La première consiste à lire la licence, car les modèles à poids ouverts ne partagent pas une même licence. Mistral Small 3, Qwen3-32B et gpt-oss-120b d'OpenAI sont publiés sur Hugging Face sous licence Apache 2.0. La Llama 3.3 Community License de Meta, qui couvre le modèle Llama 3.3 70B dont le dimensionnement est calculé ci-dessous, exige que l'usage respecte sa politique d'utilisation acceptable. Elle exige aussi qu'un licencié dont les produits ou services, y compris ceux de ses sociétés affiliées, comptaient plus de 700 millions d'utilisateurs actifs mensuels au cours du mois civil précédant la date de sortie demande une licence, que Meta peut accorder à sa seule discrétion.
Le matériel découle du nombre de paramètres et de la précision. Llama 3.3 70B Instruct compte environ 70,6 milliards de paramètres ; à 16 bits par paramètre, les poids occupent à eux seuls environ 141 Go (131 Gio), ce qui ne tient pas sur un seul accélérateur de 80 Go, avant même de réserver de la mémoire au cache clé-valeur des requêtes simultanées. La fiche de modèle (model card) de gpt-oss-120b indique que la quantification MXFP4 des poids de ses couches à mélange d'experts (mixture-of-experts) permet de faire tourner le modèle sur un seul GPU de 80 Go.
La couche de serving devient votre frontière de sécurité. La documentation de sécurité de vLLM indique que la communication entre les nœuds d'un déploiement multi-nœuds n'est pas sécurisée par défaut et doit être protégée en plaçant les nœuds sur un réseau isolé, et que son option de clé d'API ne protège que les points de terminaison situés sous certains préfixes de chemin, tandis que d'autres points de terminaison sensibles du même serveur ne sont protégés par aucune authentification. Le fichier du modèle fait lui aussi partie de la chaîne d'approvisionnement : la documentation de Python avertit que le module pickle n'est pas sécurisé et que des données pickle malveillantes peuvent exécuter du code arbitraire lors de la désérialisation (unpickling), c'est pourquoi le format safetensors, conçu pour stocker des tenseurs de manière sûre, contrairement à pickle, constitue le choix le plus sûr pour les poids.
Ce que l'entreprise exploite désormais elle-même :
Les obligations au titre du RGPD (GDPR), et de l'ISO/IEC 27001 lorsque l'entreprise est certifiée selon cette norme, restent celles de l'entreprise quelle que soit l'option choisie, même lorsqu'un fournisseur agit en tant que sous-traitant pour son compte. Ce qui change, c'est la provenance des preuves :
Dans les trois cas, les preuves coûtent moins cher quand le pipeline enregistre, au fil de l'exécution, quel déploiement, quelle région et quel modèle ont traité chaque document. Assemblées plus tard pour un audit, ces mêmes preuves relèvent de la reconstitution.
Sur une capacité partagée, le plafond de débit relève de la politique de quelqu'un d'autre. OpenAI applique des limites de débit mesurées en requêtes et en tokens par minute et par jour. Il fait passer automatiquement une organisation à un palier d'utilisation supérieur à mesure que ses dépenses augmentent, ce qui rehausse généralement ces limites, et il peut ralentir un trafic qui croît trop vite, même en deçà de ces limites. Microsoft indique que ses types de déploiement provisionnés offrent un débit garanti et une moindre variabilité de la latence, tandis que les types standard fonctionnent au mieux (best-effort).
La capacité réservée s'accompagne de ses propres conditions. Le Provisioned Throughput (débit provisionné) d'Amazon Bedrock peut s'acheter sans engagement, ou pour un ou six mois, période pendant laquelle il ne peut pas être supprimé. Microsoft précise que ni un quota de PTU ni une réservation ne garantit de capacité dans une région, et que la suppression ou la réduction d'un déploiement provisionné libère sa capacité, sans garantie que la même capacité soit disponible plus tard. OpenAI oriente les clients entreprise dont le trafic atteint régulièrement les limites de rythme de montée en charge (ramp-rate limits) vers Scale Tier, ou Reserved Tier pour GPT-5.6 et les modèles ultérieurs, afin d'obtenir une capacité plus prévisible.
Le travail que personne n'attend n'a pas besoin de cette capacité. La Batch API d'OpenAI traite des requêtes asynchrones à un coût inférieur de 50 % avec un délai de traitement de 24 heures, bien que la page d'OpenAI sur les données indique que les points de terminaison batch et fichiers ne sont pas éligibles à Zero Data Retention et que leurs données sont conservées jusqu'à leur suppression. Azure propose des types de déploiement batch avec une remise de 50 %, où Global Batch peut traiter dans n'importe quelle zone géographique où le modèle est déployé et où Data Zone Batch n'achemine le trafic que vers des datacenters situés à l'intérieur de la zone de données.
Sur une capacité en propre, il n'y a ni limites de débit externes ni file partagée, et le plafond est le matériel que vous avez acheté ou réservé. Quelle que soit l'option, la longueur de la sortie compte : le guide de latence d'OpenAI présente la génération de tokens comme l'étape presque toujours la plus coûteuse en latence et avance, à titre d'heuristique générale, que diminuer de 50 % les tokens de sortie peut réduire la latence d'environ 50 %. Demander au modèle des enregistrements structurés compacts plutôt que de la prose aide donc dans les trois cas.
Les options diffèrent par la liste des tâches qui restent au sein de l'entreprise :
Un pilote peut tourner des mois sans astreinte ; la production, non. Chiffrer une option auto-hébergée sans les personnes qui l'exploitent revient à comparer le coût d'un modèle avec le prix d'un service.
Les options ne sont pas exclusives. Un pipeline peut envoyer les documents publics à un modèle hébergé et garder les classes restreintes sur un modèle auto-hébergé. Cela ne tient que si le routage est imposé dans le code et laisse des preuves :
Un périmètre fermé ne choisit pas le modèle à votre place. Il choisit quel travail reste à votre charge : lire les contrats et attendre les approbations, réserver de la capacité dans la bonne région, ou faire tourner les serveurs et être réveillé la nuit par une alerte.
La question à l'origine de cet article est de savoir quelles entreprises d'ingénierie mettent en place le traitement de documents et de tickets par LLM dans le propre périmètre d'un client, sur site ou dans un cloud privé. Ce qui les distingue se voit à ce qu'elles demandent avant de proposer un modèle :
Un prestataire qui recommande un modèle avant de poser ces questions a choisi votre périmètre sans le dire.
La décision de déploiement se ramène au travail que votre entreprise est prête à assumer pour chaque classe de documents : contrats et approbations, capacité dans une région, ou serveurs et astreinte.
Ce qu'amBrain peut étayer publiquement au-delà de l'intégration en production décrite dans le résumé ci-dessus : amBrain construit des logiciels depuis 2019. Nous travaillons en trois formats : livraison complète, équipe dédiée ou ingénieurs intégrés à votre équipe.
Apportez votre architecture actuelle et le mode de défaillance qui vous inquiète : nous les passerons en revue ensemble en une demi-heure.