FinTechSep 15, 202611 min de lectura

LLM en un perímetro cerrado: qué puede elegir una empresa regulada y cuánto cuesta cada opción

Despliegue de LLMSectores reguladosPerímetro de datosModelos autoalojados
Error al cargar la imagen

Una empresa regulada cuyos documentos no pueden salir de su perímetro sigue teniendo tres formas de ejecutar un modelo de lenguaje: la API alojada del proveedor bajo controles contractuales, el servicio gestionado de modelos de su plataforma en la nube o un modelo de pesos abiertos en infraestructura que opera ella misma. Cada opción traslada un coste distinto a la empresa: contratos y aprobaciones, capacidad en la región adecuada, o servidores y guardias. Aquí se explica cuánto cuesta cada una en operaciones, evidencias de cumplimiento, latencia y personal, y qué preguntas muestran si una empresa de ingeniería la ha construido dentro del perímetro de un cliente.

El requisito llega como una sola frase: los documentos no pueden salir del perímetro. La decisión de arquitectura se esconde dentro de ella, porque el perímetro puede trazarse en tres lugares, y cada lugar traslada un coste distinto a la empresa que lo traza.

La API alojada de un proveedor de modelos sitúa el perímetro en un contrato con ese proveedor. El servicio gestionado de modelos de una plataforma en la nube lo sitúa en el contrato de nube. Un modelo de pesos abiertos en servidores que operas tú lo sitúa en tu propia red, y te traspasa todas las obligaciones que, de otro modo, asumiría el proveedor.

La respuesta corta: la elección no es entre seguro e inseguro, sino sobre quién asume qué trabajo. Una API alojada no necesita infraestructura propia para empezar y te ata a las condiciones de retención, los límites de tasa (rate limits) y el calendario de retirada del proveedor. Un servicio gestionado de modelos puede mantener los prompts fuera del alcance del desarrollador del modelo, en el caso de los modelos que la propia nube vende y opera, e incorpora al diseño las regiones, los tipos de despliegue y la capacidad reservada. Un modelo de pesos abiertos autoalojado mantiene la inferencia en infraestructura que controlas y convierte en tarea tuya las licencias, la capacidad de aceleradores, la seguridad del serving y las guardias. Lo que amBrain puede sustentar públicamente sobre su propio trabajo con LLM, en su totalidad: Hemos llevado a producción una integración de LLM dentro del perímetro FinTech de un cliente: extracción y normalización de avisos no estructurados de brókers y de centros de negociación —eventos corporativos, cambios de instrumentos y de márgenes— en registros estructurados que consume el sistema de trading. El cliente no se nombra, no se revela cuál de las opciones de abajo usó ese proyecto y este artículo no es un caso de estudio sobre él.

Pon por escrito lo que prohíbe el perímetro antes de comparar opciones

«No puede salir del perímetro» significa cosas distintas para un responsable de riesgos, un delegado de protección de datos y un equipo de infraestructura. Formulado como preguntas, se convierte en un requisito con el que se puede contrastar cada opción:

  • Quién de fuera de la empresa puede ver los prompts y las salidas, incluido el personal de un proveedor que los revisa en busca de abusos
  • En qué regiones pueden procesarse los datos, no solo dónde se almacenan
  • Qué puede conservarse después de una solicitud, durante cuánto tiempo y quién puede eliminarlo
  • Si el tráfico puede atravesar la internet pública, aunque vaya cifrado
  • Quién tiene las claves de cifrado y los logs que demuestran quién accedió a qué
  • Qué contratos, registros y auditorías conlleva el uso de un proveedor externo

Las respuestas pueden variar según la clase de datos. Un aviso regulatorio que ya es público y el documento de identidad de un cliente no necesitan el mismo perímetro, y un pipeline puede enrutarlos de forma distinta.

Opción uno: la API alojada del proveedor, con el perímetro en el contrato

Aquí son el contrato y la documentación del proveedor los que definen el perímetro, así que se leen línea por línea. La documentación de OpenAI sobre los datos de la API indica que, desde el 1 de marzo de 2023, los datos enviados a la API no se usan para entrenar ni mejorar sus modelos, salvo que el cliente lo acepte expresamente (opt-in). La misma página indica que los logs de monitorización de abusos, que pueden contener prompts y respuestas, se generan por defecto y se conservan hasta 30 días, salvo que la ley exija una retención más larga o que esta sea razonablemente necesaria para proteger el servicio o a terceros frente a daños.

Ambos límites pueden restringirse, y cada restricción pasa por una aprobación, no por un ajuste de configuración:

  • Zero Data Retention (retención cero de datos) o Modified Abuse Monitoring (monitorización de abusos modificada) excluye el contenido del cliente de los logs de monitorización de abusos una vez que OpenAI aprueba al cliente. Los endpoints que la documentación marca como no elegibles pueden seguir conservando el estado de la aplicación, algunos de ellos hasta que se elimina, y OpenAI se reserva el derecho a declarar no elegibles modelos concretos mediante notificación por escrito
  • La residencia de datos se configura por proyecto o se selecciona por solicitud, la elegibilidad se comprueba con el equipo de ventas, y cualquier región distinta de Estados Unidos requiere la aprobación de los controles de monitorización de abusos y una Modified Retention amendment (adenda contractual de retención modificada)
  • La residencia de datos almacena el contenido del cliente en reposo en la región seleccionada; la inferencia también se ejecuta allí solo en las regiones que la documentación marca como compatibles con el procesamiento regional
  • La residencia de datos no cubre los datos del sistema, es decir, los datos de cuenta, los metadatos y los datos de uso sin contenido del cliente, que pueden procesarse y almacenarse fuera de la región seleccionada
  • La misma página indica que a los endpoints de residencia de datos se les aplica un recargo del 10% en los modelos elegibles lanzados el 5 de marzo de 2026 o después

El modelo también sigue el calendario del proveedor. La página de obsolescencia de modelos (deprecations) de OpenAI establece plazos mínimos de preaviso antes de la retirada, salvo que motivos de seguridad o de cumplimiento exijan un calendario más rápido: al menos 6 meses para un modelo con disponibilidad general, al menos 3 meses para sus variantes especializadas y un preaviso mucho más corto, como 2 semanas, para los modelos en versión preliminar. Cada retirada implica puntuar el sustituto con tus propios documentos antes de esa fecha, así que la migración es trabajo planificado y recurrente, no un incidente.

Opción dos: el servicio gestionado de modelos de tu plataforma en la nube

Las plataformas en la nube ofrecen modelos de varios desarrolladores, algunos de ellos bajo el contrato de nube que una empresa quizá ya tenga. La documentación de Microsoft sobre los modelos vendidos por Azure en Microsoft Foundry indica que los prompts, las completions y los embeddings no están disponibles para OpenAI ni para otros proveedores de esos modelos. El mismo catálogo incluye modelos que Microsoft no vende: para los modelos Claude en Microsoft Foundry, su documentación designa a Anthropic como vendedor, operador y encargado independiente del tratamiento de los prompts y las salidas, y una de las opciones de alojamiento los procesa en la infraestructura de Anthropic, posiblemente fuera de la región de Azure seleccionada.

La documentación de Amazon Bedrock describe una cuenta de despliegue de modelos por cada proveedor de modelos en cada región, propiedad del equipo del servicio Bedrock y operada por él, a la que los proveedores de modelos no tienen acceso, de modo que no ven los prompts ni las completions de los clientes.

Aun así, el modelo se ejecuta en infraestructura que opera la nube, no en tu propia red. Para algunos perímetros eso cuenta como dentro; para otros, solo la tercera opción cuenta como dentro. Cuando cuenta, el perímetro depende de las decisiones que se toman en el tenant, y la documentación detalla sus consecuencias:

  • Dónde se ejecuta la inferencia: en Azure, un tipo de despliegue etiquetado como Global puede procesar prompts y respuestas en cualquier geografía en la que esté desplegado el modelo; un tipo Data Zone, dentro de la zona de datos; y un tipo Standard o Provisioned basado en geografía, dentro de la geografía especificada por el cliente; en todos ellos, los datos en reposo permanecen en la geografía designada por el cliente
  • Qué modelos obtienes: Microsoft indica que los modelos nuevos se lanzan primero en Global Standard, llegan más tarde a Data Zone y a los tipos de despliegue regionales, y no está garantizado que lleguen a todos los tipos de despliegue
  • Cuánto vive una versión: Azure fija la fecha de retirada de un modelo con disponibilidad general 18 meses después de su lanzamiento y lo cierra a clientes nuevos a los 12 meses; los modelos con disponibilidad general de Anthropic, DeepSeek, Fireworks y Mistral AI siguen un ciclo de vida de 12 meses, y Microsoft se reserva el derecho a una retirada de emergencia con un preaviso más corto
  • Cómo llega el tráfico al modelo: Amazon Bedrock admite endpoints de VPC de tipo interfaz a través de AWS PrivateLink para su API de runtime, de modo que las llamadas desde tu VPC llegan al modelo sin un internet gateway ni direcciones IP públicas
  • Quién revisa el contenido en busca de abusos: en Azure, los clientes que cumplen criterios de elegibilidad adicionales de Limited Access pueden solicitar la modificación de la monitorización de abusos; una vez aprobada, los prompts y las completions no se almacenan para revisión humana, aunque puede seguir ejecutándose una revisión automatizada

Para una entidad financiera de la UE dentro del ámbito de DORA, el contrato de nube ya es un acuerdo con un proveedor tercero de servicios de TIC. El 18 de noviembre de 2025, las Autoridades Europeas de Supervisión publicaron la lista de proveedores terceros esenciales de servicios de TIC sujetos a supervisión a escala de la UE, y en ella figuran Amazon Web Services EMEA, Google Cloud EMEA y Microsoft Ireland Operations. La Autoridad Bancaria Europea señala que DORA es aplicable desde el 17 de enero de 2025 y que las entidades dentro de su ámbito deben mantener un registro de sus acuerdos contractuales con proveedores terceros de servicios de TIC. Por tanto, un proveedor de modelos con el que la entidad no ha contratado antes, o un servicio nuevo bajo un contrato de nube que ya tiene, es una cuestión para ese registro, no solo para la arquitectura.

Opción tres: un modelo de pesos abiertos en infraestructura que operas tú

El autoalojamiento, en instalaciones propias o en máquinas virtuales de tu propia cuenta en la nube, trae la inferencia dentro, junto con todas las obligaciones que asumía el proveedor. La primera obligación es leer la licencia, porque los modelos de pesos abiertos no comparten una misma licencia. Mistral Small 3, Qwen3-32B y gpt-oss-120b de OpenAI están publicados en Hugging Face bajo Apache 2.0. La Llama 3.3 Community License de Meta, que cubre el modelo Llama 3.3 70B que se dimensiona más abajo, exige que el uso respete su política de uso aceptable. También exige que un licenciatario cuyos productos o servicios, incluidos los de sus filiales, tuvieran más de 700 millones de usuarios activos mensuales en el mes natural anterior a la fecha de lanzamiento solicite una licencia, que Meta puede conceder a su entera discreción.

El hardware se deriva del número de parámetros y de la precisión. Llama 3.3 70B Instruct tiene unos 70.6 mil millones de parámetros; con 16 bits por parámetro, solo los pesos ocupan unos 141 GB (131 GiB) y no caben en un único acelerador de 80 GB ni siquiera antes de reservar memoria para la caché key-value de las solicitudes concurrentes. La model card de gpt-oss-120b indica que la cuantización MXFP4 de los pesos de su mezcla de expertos (mixture-of-experts) permite ejecutar el modelo en una sola GPU de 80 GB.

La capa de serving se convierte en tu frontera de seguridad. La documentación de seguridad de vLLM indica que la comunicación entre los nodos de un despliegue multinodo es insegura por defecto y debe protegerse situando los nodos en una red aislada, y que su opción de API key protege solo los endpoints bajo determinados prefijos de ruta, mientras que otros endpoints sensibles del mismo servidor no tienen autenticación. El archivo del modelo también forma parte de la cadena de suministro: la documentación de Python advierte de que el módulo pickle no es seguro y de que unos datos pickle maliciosos pueden ejecutar código arbitrario durante el unpickling, y por eso el formato safetensors, creado para almacenar tensores de forma segura, a diferencia de pickle, es la opción más segura para los pesos.

Lo que ahora opera la propia empresa:

  • Capacidad de aceleradores dimensionada para el volumen de pico, comprada o reservada antes de que llegue la demanda, con margen para un nodo caído
  • Los drivers, el motor de serving y el sistema operativo, parcheados según un calendario que permitan tanto la seguridad como las puntuaciones de aceptación
  • Aislamiento de red, autenticación delante del servidor del modelo y logs de acceso que un auditor pueda leer
  • Actualizaciones de modelo: un modelo de pesos abiertos más reciente llega a producción solo cuando alguien lo puntúa con tus documentos y lo incluye en una release
  • Guardias para el servidor del modelo, porque ninguna página de estado de un proveedor lo cubre

Evidencias de cumplimiento: qué pide el auditor en cada opción

Las obligaciones derivadas del RGPD (GDPR), y de ISO/IEC 27001 cuando la empresa está certificada conforme a esa norma, siguen siendo de la propia empresa sea cual sea la opción que elija, incluso cuando un proveedor actúa como su encargado del tratamiento. Lo que cambia es de dónde salen las evidencias:

  • API alojada: las condiciones de tratamiento de datos del proveedor, las aprobaciones de los controles de retención y de residencia, sus subencargados del tratamiento y, para una entidad financiera dentro del ámbito de DORA, la entrada del acuerdo en el registro
  • Servicio gestionado de modelos: el tipo de despliegue y la región de cada despliegue de modelo, la configuración del endpoint privado, cualquier cambio aprobado en la monitorización de abusos y si los informes de aseguramiento que la nube ya tiene incluyen el nuevo servicio en su alcance
  • Modelo autoalojado: tus propias evidencias sobre el servidor del modelo y todo lo que lo rodea, desde el aislamiento de red y los logs de acceso hasta la licencia de cada modelo y la procedencia de cada archivo de pesos en producción, además del acuerdo de nube existente cuando los servidores son máquinas virtuales en una cuenta en la nube

En las tres, las evidencias salen más baratas cuando el pipeline registra sobre la marcha qué despliegue, qué región y qué modelo procesaron cada documento. Reunidas más tarde para una auditoría, esas mismas evidencias son una reconstrucción.

Latencia y throughput: capacidad compartida o capacidad propia

Con capacidad compartida, el techo de throughput lo marca la política de otro. OpenAI aplica límites de tasa medidos en solicitudes y tokens por minuto y por día. Asigna automáticamente a una organización un nivel de uso superior a medida que crece su gasto, lo que normalmente eleva esos límites, y puede ralentizar el tráfico que crece demasiado rápido incluso dentro de ellos. Microsoft indica que sus tipos de despliegue aprovisionados ofrecen throughput garantizado y menor variabilidad de latencia, mientras que los tipos estándar funcionan en modalidad best-effort.

La capacidad reservada tiene sus propias condiciones. Amazon Bedrock Provisioned Throughput puede comprarse sin compromiso, o por uno o seis meses, periodo durante el cual no puede eliminarse. Microsoft señala que ni la cuota de PTU ni una reserva garantizan capacidad en una región, y que eliminar o reducir un despliegue aprovisionado libera su capacidad, sin garantía de que esa misma capacidad esté disponible más adelante. OpenAI remite a los clientes enterprise cuyo tráfico alcanza habitualmente los límites de ritmo de crecimiento (ramp rate) a Scale Tier, o a Reserved Tier para GPT-5.6 y modelos posteriores, para disponer de una capacidad más predecible.

El trabajo que nadie está esperando no necesita esa capacidad. La Batch API de OpenAI procesa solicitudes asíncronas con un coste un 50% menor y un plazo de respuesta de 24 horas, aunque la página de datos de OpenAI indica que los endpoints de batch y de archivos no son elegibles para Zero Data Retention y que sus datos se conservan hasta que se eliminan. Azure ofrece tipos de despliegue por lotes con un descuento del 50%, en los que Global Batch puede procesar en cualquier geografía en la que esté desplegado el modelo y Data Zone Batch enruta el tráfico solo a centros de datos dentro de la zona de datos.

Con capacidad propia no hay límites de tasa externos ni cola compartida, y el techo es el hardware que compraste o reservaste. En todas las opciones importa la longitud de la salida: la guía de latencia de OpenAI señala que generar tokens es casi siempre el paso de mayor latencia e indica, como heurística general, que reducir los tokens de salida un 50% puede reducir la latencia en torno a un 50%. Por eso, pedir al modelo registros estructurados compactos en lugar de prosa ayuda en las tres.

Personal: quién está de guardia en cada opción

Las opciones se diferencian en la lista de tareas que se quedan dentro de la empresa:

  • En todas las opciones: el propio pipeline, sus puntuaciones de aceptación y un responsable que lo opere
  • API alojada: gestión de proveedores, aprobaciones de retención y de residencia, planificación de los límites de tasa y migraciones según el calendario de retirada del proveedor
  • Servicio gestionado de modelos: el mismo trabajo, aplicado a la nube, más los tipos de despliegue, las cuotas y la capacidad reservada por región, y la red privada
  • Modelo autoalojado: la infraestructura de aceleradores, el motor de serving, los parches de seguridad, las actualizaciones de modelo y las guardias durante todas las horas en que funcione el pipeline

Un piloto puede funcionar durante meses sin guardias; producción no. Calcular el coste de una opción autoalojada sin contar a las personas que la operan es comparar el coste de un modelo con el precio de un servicio.

Combinar opciones es una regla de enrutamiento, y la regla es la parte difícil

Las opciones no son excluyentes. Un pipeline puede enviar los documentos públicos a un modelo alojado y mantener las clases restringidas en uno autoalojado. Eso solo se sostiene cuando el enrutamiento se impone en el código y deja evidencias:

  • La clasificación se hace antes de cualquier llamada al modelo, y un documento que no puede clasificarse toma la ruta más restrictiva
  • Cada ruta es un despliegue independiente con sus propias credenciales, y la ruta restringida no tiene ni credenciales ni acceso de red al modelo externo, de modo que un documento mal enrutado falla en lugar de salir del perímetro
  • Cada ruta se puntúa con el mismo conjunto de aceptación, porque dos modelos en un mismo pipeline son dos niveles de calidad
  • La ruta seguida se registra por documento, de modo que, en una auditoría, la pregunta de qué proveedor procesó qué documento se responde con registros

Un perímetro cerrado no elige el modelo por ti. Elige qué trabajo sigue siendo tuyo: leer contratos y esperar aprobaciones, reservar capacidad en la región adecuada, u operar los servidores y levantarte de noche cuando salta una alerta.

La empresa que construye esto dentro de tu perímetro pregunta primero por el perímetro

La pregunta que motiva este artículo es qué empresas de ingeniería construyen procesamiento de documentos y tickets con LLM dentro del propio perímetro de un cliente, en instalaciones propias o en una nube privada. Lo que las distingue se ve en lo que preguntan antes de proponer un modelo:

  • Pregunta qué clases de datos verá el pipeline y qué prohíbe el perímetro para cada una, en los términos que usan tus equipos de riesgos y de protección de datos
  • Pregunta qué contratos de nube, regiones y proveedores aprobados tienes ya, y si el nuevo uso entra en un registro como el que exige DORA
  • Compara al menos dos opciones de despliegue con tus propios documentos y el mismo conjunto de aceptación, en lugar de suponer que gana el modelo más grande
  • Cita las condiciones de retención, residencia y retirada de cualquier opción alojada junto con la fecha en que las leyó
  • Para el autoalojamiento, dimensiona el hardware a partir de volúmenes de tokens medidos y concreta quién parchea los servidores y quién está de guardia
  • Muestra cómo registra el pipeline el despliegue, la región y la versión del modelo que procesaron cada documento

Una empresa que recomienda un modelo antes de hacer estas preguntas ha elegido tu perímetro sin decirlo.

La decisión de despliegue se reduce a qué trabajo está dispuesta a asumir tu empresa para cada clase de documento: contratos y aprobaciones, capacidad en una región, o servidores y guardias.

Lo que amBrain puede sustentar públicamente más allá de la integración en producción descrita en el resumen de arriba: amBrain lleva construyendo software desde 2019. Trabajamos en tres formatos: entrega completa, un equipo dedicado o ingenieros integrados en tu equipo.

¿Tiene un diseño así sobre la mesa?

Traiga su arquitectura actual y el modo de fallo que le preocupa, y lo repasaremos juntos en media hora.

Artículos relacionados

Error al cargar la imagen
FinTech
Sep 14, 202610 min de lectura

El piloto de IA que nunca llegó a producción: qué faltaba en datos y operaciones

Leer artículo
Error al cargar la imagen
FinTech
Sep 9, 202610 min de lectura

Datos de mercado L2 bajo ráfagas: gaps de secuencia, recuperación y fan-out a cientos de sesiones

Leer artículo
Error al cargar la imagen
FinTech
Sep 9, 202610 min de lectura

Contratar ingenieros o traer un socio técnico: cómo calcular el coste de ambas vías

Leer artículo