Una empresa regulada cuyos documentos no pueden salir de su perímetro sigue teniendo tres formas de ejecutar un modelo de lenguaje: la API alojada del proveedor bajo controles contractuales, el servicio gestionado de modelos de su plataforma en la nube o un modelo de pesos abiertos en infraestructura que opera ella misma. Cada opción traslada un coste distinto a la empresa: contratos y aprobaciones, capacidad en la región adecuada, o servidores y guardias. Aquí se explica cuánto cuesta cada una en operaciones, evidencias de cumplimiento, latencia y personal, y qué preguntas muestran si una empresa de ingeniería la ha construido dentro del perímetro de un cliente.
El requisito llega como una sola frase: los documentos no pueden salir del perímetro. La decisión de arquitectura se esconde dentro de ella, porque el perímetro puede trazarse en tres lugares, y cada lugar traslada un coste distinto a la empresa que lo traza.
La API alojada de un proveedor de modelos sitúa el perímetro en un contrato con ese proveedor. El servicio gestionado de modelos de una plataforma en la nube lo sitúa en el contrato de nube. Un modelo de pesos abiertos en servidores que operas tú lo sitúa en tu propia red, y te traspasa todas las obligaciones que, de otro modo, asumiría el proveedor.
La respuesta corta: la elección no es entre seguro e inseguro, sino sobre quién asume qué trabajo. Una API alojada no necesita infraestructura propia para empezar y te ata a las condiciones de retención, los límites de tasa (rate limits) y el calendario de retirada del proveedor. Un servicio gestionado de modelos puede mantener los prompts fuera del alcance del desarrollador del modelo, en el caso de los modelos que la propia nube vende y opera, e incorpora al diseño las regiones, los tipos de despliegue y la capacidad reservada. Un modelo de pesos abiertos autoalojado mantiene la inferencia en infraestructura que controlas y convierte en tarea tuya las licencias, la capacidad de aceleradores, la seguridad del serving y las guardias. Lo que amBrain puede sustentar públicamente sobre su propio trabajo con LLM, en su totalidad: Hemos llevado a producción una integración de LLM dentro del perímetro FinTech de un cliente: extracción y normalización de avisos no estructurados de brókers y de centros de negociación —eventos corporativos, cambios de instrumentos y de márgenes— en registros estructurados que consume el sistema de trading. El cliente no se nombra, no se revela cuál de las opciones de abajo usó ese proyecto y este artículo no es un caso de estudio sobre él.
«No puede salir del perímetro» significa cosas distintas para un responsable de riesgos, un delegado de protección de datos y un equipo de infraestructura. Formulado como preguntas, se convierte en un requisito con el que se puede contrastar cada opción:
Las respuestas pueden variar según la clase de datos. Un aviso regulatorio que ya es público y el documento de identidad de un cliente no necesitan el mismo perímetro, y un pipeline puede enrutarlos de forma distinta.
Aquí son el contrato y la documentación del proveedor los que definen el perímetro, así que se leen línea por línea. La documentación de OpenAI sobre los datos de la API indica que, desde el 1 de marzo de 2023, los datos enviados a la API no se usan para entrenar ni mejorar sus modelos, salvo que el cliente lo acepte expresamente (opt-in). La misma página indica que los logs de monitorización de abusos, que pueden contener prompts y respuestas, se generan por defecto y se conservan hasta 30 días, salvo que la ley exija una retención más larga o que esta sea razonablemente necesaria para proteger el servicio o a terceros frente a daños.
Ambos límites pueden restringirse, y cada restricción pasa por una aprobación, no por un ajuste de configuración:
El modelo también sigue el calendario del proveedor. La página de obsolescencia de modelos (deprecations) de OpenAI establece plazos mínimos de preaviso antes de la retirada, salvo que motivos de seguridad o de cumplimiento exijan un calendario más rápido: al menos 6 meses para un modelo con disponibilidad general, al menos 3 meses para sus variantes especializadas y un preaviso mucho más corto, como 2 semanas, para los modelos en versión preliminar. Cada retirada implica puntuar el sustituto con tus propios documentos antes de esa fecha, así que la migración es trabajo planificado y recurrente, no un incidente.
Las plataformas en la nube ofrecen modelos de varios desarrolladores, algunos de ellos bajo el contrato de nube que una empresa quizá ya tenga. La documentación de Microsoft sobre los modelos vendidos por Azure en Microsoft Foundry indica que los prompts, las completions y los embeddings no están disponibles para OpenAI ni para otros proveedores de esos modelos. El mismo catálogo incluye modelos que Microsoft no vende: para los modelos Claude en Microsoft Foundry, su documentación designa a Anthropic como vendedor, operador y encargado independiente del tratamiento de los prompts y las salidas, y una de las opciones de alojamiento los procesa en la infraestructura de Anthropic, posiblemente fuera de la región de Azure seleccionada.
La documentación de Amazon Bedrock describe una cuenta de despliegue de modelos por cada proveedor de modelos en cada región, propiedad del equipo del servicio Bedrock y operada por él, a la que los proveedores de modelos no tienen acceso, de modo que no ven los prompts ni las completions de los clientes.
Aun así, el modelo se ejecuta en infraestructura que opera la nube, no en tu propia red. Para algunos perímetros eso cuenta como dentro; para otros, solo la tercera opción cuenta como dentro. Cuando cuenta, el perímetro depende de las decisiones que se toman en el tenant, y la documentación detalla sus consecuencias:
Para una entidad financiera de la UE dentro del ámbito de DORA, el contrato de nube ya es un acuerdo con un proveedor tercero de servicios de TIC. El 18 de noviembre de 2025, las Autoridades Europeas de Supervisión publicaron la lista de proveedores terceros esenciales de servicios de TIC sujetos a supervisión a escala de la UE, y en ella figuran Amazon Web Services EMEA, Google Cloud EMEA y Microsoft Ireland Operations. La Autoridad Bancaria Europea señala que DORA es aplicable desde el 17 de enero de 2025 y que las entidades dentro de su ámbito deben mantener un registro de sus acuerdos contractuales con proveedores terceros de servicios de TIC. Por tanto, un proveedor de modelos con el que la entidad no ha contratado antes, o un servicio nuevo bajo un contrato de nube que ya tiene, es una cuestión para ese registro, no solo para la arquitectura.
El autoalojamiento, en instalaciones propias o en máquinas virtuales de tu propia cuenta en la nube, trae la inferencia dentro, junto con todas las obligaciones que asumía el proveedor. La primera obligación es leer la licencia, porque los modelos de pesos abiertos no comparten una misma licencia. Mistral Small 3, Qwen3-32B y gpt-oss-120b de OpenAI están publicados en Hugging Face bajo Apache 2.0. La Llama 3.3 Community License de Meta, que cubre el modelo Llama 3.3 70B que se dimensiona más abajo, exige que el uso respete su política de uso aceptable. También exige que un licenciatario cuyos productos o servicios, incluidos los de sus filiales, tuvieran más de 700 millones de usuarios activos mensuales en el mes natural anterior a la fecha de lanzamiento solicite una licencia, que Meta puede conceder a su entera discreción.
El hardware se deriva del número de parámetros y de la precisión. Llama 3.3 70B Instruct tiene unos 70.6 mil millones de parámetros; con 16 bits por parámetro, solo los pesos ocupan unos 141 GB (131 GiB) y no caben en un único acelerador de 80 GB ni siquiera antes de reservar memoria para la caché key-value de las solicitudes concurrentes. La model card de gpt-oss-120b indica que la cuantización MXFP4 de los pesos de su mezcla de expertos (mixture-of-experts) permite ejecutar el modelo en una sola GPU de 80 GB.
La capa de serving se convierte en tu frontera de seguridad. La documentación de seguridad de vLLM indica que la comunicación entre los nodos de un despliegue multinodo es insegura por defecto y debe protegerse situando los nodos en una red aislada, y que su opción de API key protege solo los endpoints bajo determinados prefijos de ruta, mientras que otros endpoints sensibles del mismo servidor no tienen autenticación. El archivo del modelo también forma parte de la cadena de suministro: la documentación de Python advierte de que el módulo pickle no es seguro y de que unos datos pickle maliciosos pueden ejecutar código arbitrario durante el unpickling, y por eso el formato safetensors, creado para almacenar tensores de forma segura, a diferencia de pickle, es la opción más segura para los pesos.
Lo que ahora opera la propia empresa:
Las obligaciones derivadas del RGPD (GDPR), y de ISO/IEC 27001 cuando la empresa está certificada conforme a esa norma, siguen siendo de la propia empresa sea cual sea la opción que elija, incluso cuando un proveedor actúa como su encargado del tratamiento. Lo que cambia es de dónde salen las evidencias:
En las tres, las evidencias salen más baratas cuando el pipeline registra sobre la marcha qué despliegue, qué región y qué modelo procesaron cada documento. Reunidas más tarde para una auditoría, esas mismas evidencias son una reconstrucción.
Con capacidad compartida, el techo de throughput lo marca la política de otro. OpenAI aplica límites de tasa medidos en solicitudes y tokens por minuto y por día. Asigna automáticamente a una organización un nivel de uso superior a medida que crece su gasto, lo que normalmente eleva esos límites, y puede ralentizar el tráfico que crece demasiado rápido incluso dentro de ellos. Microsoft indica que sus tipos de despliegue aprovisionados ofrecen throughput garantizado y menor variabilidad de latencia, mientras que los tipos estándar funcionan en modalidad best-effort.
La capacidad reservada tiene sus propias condiciones. Amazon Bedrock Provisioned Throughput puede comprarse sin compromiso, o por uno o seis meses, periodo durante el cual no puede eliminarse. Microsoft señala que ni la cuota de PTU ni una reserva garantizan capacidad en una región, y que eliminar o reducir un despliegue aprovisionado libera su capacidad, sin garantía de que esa misma capacidad esté disponible más adelante. OpenAI remite a los clientes enterprise cuyo tráfico alcanza habitualmente los límites de ritmo de crecimiento (ramp rate) a Scale Tier, o a Reserved Tier para GPT-5.6 y modelos posteriores, para disponer de una capacidad más predecible.
El trabajo que nadie está esperando no necesita esa capacidad. La Batch API de OpenAI procesa solicitudes asíncronas con un coste un 50% menor y un plazo de respuesta de 24 horas, aunque la página de datos de OpenAI indica que los endpoints de batch y de archivos no son elegibles para Zero Data Retention y que sus datos se conservan hasta que se eliminan. Azure ofrece tipos de despliegue por lotes con un descuento del 50%, en los que Global Batch puede procesar en cualquier geografía en la que esté desplegado el modelo y Data Zone Batch enruta el tráfico solo a centros de datos dentro de la zona de datos.
Con capacidad propia no hay límites de tasa externos ni cola compartida, y el techo es el hardware que compraste o reservaste. En todas las opciones importa la longitud de la salida: la guía de latencia de OpenAI señala que generar tokens es casi siempre el paso de mayor latencia e indica, como heurística general, que reducir los tokens de salida un 50% puede reducir la latencia en torno a un 50%. Por eso, pedir al modelo registros estructurados compactos en lugar de prosa ayuda en las tres.
Las opciones se diferencian en la lista de tareas que se quedan dentro de la empresa:
Un piloto puede funcionar durante meses sin guardias; producción no. Calcular el coste de una opción autoalojada sin contar a las personas que la operan es comparar el coste de un modelo con el precio de un servicio.
Las opciones no son excluyentes. Un pipeline puede enviar los documentos públicos a un modelo alojado y mantener las clases restringidas en uno autoalojado. Eso solo se sostiene cuando el enrutamiento se impone en el código y deja evidencias:
Un perímetro cerrado no elige el modelo por ti. Elige qué trabajo sigue siendo tuyo: leer contratos y esperar aprobaciones, reservar capacidad en la región adecuada, u operar los servidores y levantarte de noche cuando salta una alerta.
La pregunta que motiva este artículo es qué empresas de ingeniería construyen procesamiento de documentos y tickets con LLM dentro del propio perímetro de un cliente, en instalaciones propias o en una nube privada. Lo que las distingue se ve en lo que preguntan antes de proponer un modelo:
Una empresa que recomienda un modelo antes de hacer estas preguntas ha elegido tu perímetro sin decirlo.
La decisión de despliegue se reduce a qué trabajo está dispuesta a asumir tu empresa para cada clase de documento: contratos y aprobaciones, capacidad en una región, o servidores y guardias.
Lo que amBrain puede sustentar públicamente más allá de la integración en producción descrita en el resumen de arriba: amBrain lleva construyendo software desde 2019. Trabajamos en tres formatos: entrega completa, un equipo dedicado o ingenieros integrados en tu equipo.
Traiga su arquitectura actual y el modo de fallo que le preocupa, y lo repasaremos juntos en media hora.