amBrain
FinTechSep 18, 202610 min de lectura

IA en tus propios servidores: cómo añadir un LLM a tus sistemas internos y quién la construye

IA en servidores propiosIntegración de LLMDel piloto a producciónQuién la construye
Error al cargar la imagen

Una empresa puede ejecutar un modelo de lenguaje grande en servidores que controla y conectarlo a sus tickets de soporte, documentos y herramientas internas sin que esos datos salgan. Este artículo explica, en palabras sencillas, qué tareas encajan, dónde puede ejecutarse el modelo, qué decidir antes de contratar a nadie, qué tipos de coste esperar, por qué los pilotos se atascan antes de llegar a producción y cómo evaluar a una empresa que se ofrece a construirlo.

Sí, una empresa puede usar IA en sus tickets de soporte, documentos y herramientas internas sin que esos datos salgan de sus propios servidores. Un modelo de lenguaje grande, o LLM, es el tipo de IA que hay detrás de los asistentes de chat. Algunos de estos modelos se pueden descargar y ejecutar en servidores que controla la empresa, en su propio edificio o en su propia cuenta en la nube, y conectar a los sistemas que el personal ya usa.

El modelo es la parte menor del trabajo. Lo que decide si el sistema llega al uso diario es la elección de la tarea, una descripción por escrito de una respuesta correcta y una persona concreta que revisa las respuestas y opera el sistema tras el lanzamiento. La última parte de este artículo muestra cómo evaluar a una empresa que se ofrece a construirlo.

La respuesta corta: ejecuta un modelo de pesos abiertos en servidores que controlas y conéctalo primero a una tarea en un sistema, como clasificar tickets de soporte o leer documentos entrantes. Antes de contratar a nadie, pon por escrito qué datos puede ver el modelo, cómo es una respuesta correcta, quién revisa las respuestas al principio y quién opera el sistema tras el lanzamiento. Después contrata a quien pregunte por esas respuestas antes de recomendar un modelo.

¿Qué significa realmente «IA en nuestros propios servidores»?

«IA en nuestros propios servidores» significa que el modelo se ejecuta en hardware que controla tu empresa y que ningún texto se envía a una empresa de IA externa. Tu ticket, documento o pregunta va de tu sistema al modelo y vuelve, y nunca sale de tu red ni de tu cuenta en la nube.

Esto es posible gracias a los modelos de pesos abiertos. Un modelo de pesos abiertos es aquel cuyo desarrollador publica los archivos del modelo, de modo que cualquiera puede descargarlos y ejecutar el modelo según su licencia. Los servicios de IA que usas en un navegador funcionan de otra manera: tu texto viaja a los servidores del proveedor y se procesa allí.

Mantener los datos dentro abarca más que el modelo. El sistema también guarda logs, un índice de búsqueda de tus documentos, los ejemplos con los que se prueba y las pantallas donde las personas revisan sus respuestas. Cada uno de estos elementos contiene copias de tus datos, y cada uno tiene que quedarse también en tus servidores.

¿Qué tareas de nuestros sistemas internos puede asumir un LLM?

Un LLM es útil allí donde hoy las personas leen texto y después rellenan, clasifican o escriben algo. Tareas típicas dentro de una empresa:

  • Leer documentos entrantes. Formularios, facturas, contratos y avisos se convierten en campos del sistema que los necesita
  • Clasificar tickets de soporte. El tema, la urgencia y el equipo adecuado quedan fijados antes de que una persona abra el ticket
  • Redactar respuestas. El modelo escribe un borrador, y un agente de soporte lo edita y lo envía
  • Responder preguntas del personal a partir de documentos internos. Políticas, manuales y tickets anteriores, con un enlace a la fuente de cada respuesta. Es lo que a menudo se llama «un ChatGPT privado»
  • Resumir material largo. Hilos de correo, notas de llamadas y expedientes, para la siguiente persona que los retome
  • Revisar documentos contra una lista. Si un contrato tiene las cláusulas obligatorias o si una solicitud tiene todos los documentos que necesita

Algunos trabajos encajan mal con un LLM, y es mejor saberlo antes de que empiece el proyecto:

  • Cálculos y reglas que ya son exactos. El código normal los hace más rápido y da la misma respuesta cada vez
  • Tareas en las que nadie puede decir cómo es una respuesta correcta. Sin eso, nadie puede saber si el modelo funciona
  • Decisiones finales sobre personas con peso legal o financiero, como rechazar a un cliente, sin que una persona tome la decisión
  • Acciones que no se pueden deshacer y que nadie revisa, como enviar dinero

Una prueba sencilla para cualquier tarea: encaja con un LLM cuando hoy la hace una persona leyendo texto, el resultado correcto se puede poner por escrito y un resultado erróneo se puede detectar antes de que cause daño.

Nuestros datos no pueden salir de nuestros servidores. ¿Podemos usar IA igualmente?

Sí. La elección es dónde se ejecuta el modelo, y solo dos de las tres opciones habituales mantienen los datos en servidores que controlas:

  • Un modelo de pesos abiertos en tus propios servidores. El modelo se ejecuta en hardware de tu propio edificio o centro de datos. Obtienes: ningún texto sale de tu red y ninguna empresa de IA externa lo recibe. Lo que cedes: compras servidores con procesadores gráficos (GPU), que los modelos necesitan para funcionar a una velocidad útil, y tu equipo o un socio los mantiene en marcha. Elige esta opción cuando: las normas, los contratos con clientes o tu propia política prohíben cualquier procesamiento fuera de la empresa
  • Un modelo de pesos abiertos en tu propia cuenta en la nube. El mismo tipo de modelo se ejecuta en servidores que alquilas a un proveedor de nube, dentro de tu cuenta y en la región que elijas. Obtienes: ningún hardware que comprar, capacidad que puedes ampliar más adelante y datos que se quedan en tu cuenta. Lo que cedes: el proveedor de nube gestiona los edificios y el hardware, y el modelo lo sigues operando tú. Elige esta opción cuando: tu empresa ya tiene sus sistemas en esa nube y tus normas lo aceptan
  • El servicio de un proveedor de modelos. Envías texto a un modelo operado por una empresa de IA, directamente o a través de tu proveedor de nube, bajo contrato. Obtienes: el arranque más rápido, los modelos propios del proveedor y ningún servidor que operar. Lo que cedes: los datos sí salen de tus servidores, bajo las condiciones del proveedor sobre almacenamiento, ubicación y revisión. Elige esta opción cuando: los datos pueden salir bajo contrato, como documentos que ya son públicos. Si tus datos de verdad no pueden salir, esta opción queda descartada

Una empresa puede usar más de una opción. Los documentos públicos pueden ir al servicio de un proveedor mientras los registros de clientes se quedan en un modelo que operas tú. En ese caso, la regla que envía cada tipo de dato a su sitio tiene que ponerse por escrito y hacerse cumplir. Un artículo anterior de este blog, sobre ejecutar un LLM en un perímetro cerrado, compara estas opciones con más detalle.

Si un modelo que puedes ejecutar tú mismo es lo bastante bueno se mide con tus propios documentos y tickets, no se toma de un ranking público. Muchas tareas internas son acotadas, como leer un tipo de formulario o clasificar tickets en una lista conocida de equipos, y una prueba con ejemplos reales de tu trabajo responde a la pregunta.

Los modelos de pesos abiertos vienen con licencias distintas, así que alguien debería leer la licencia del modelo que elijas. Los modelos Qwen3 que Alibaba publicó en 2025 y los modelos gpt-oss de OpenAI se publican bajo la licencia Apache 2.0, mientras que el modelo abierto más grande del posterior lanzamiento Qwen3.8 viene con su propia licencia Qwen3.8-Max. Llama 3.3 de Meta viene con la licencia comunitaria propia de Meta, que añade condiciones, entre ellas cumplir la política de uso aceptable de Meta.

¿Cómo añado un LLM a los sistemas internos de mi empresa?

Un LLM no sustituye tus sistemas. Se sitúa entre ellos: lee texto de un sitio y deja un resultado en otro. Añadirlo a un sistema interno significa responder a cuatro preguntas sencillas:

  • ¿De dónde viene el texto? Del helpdesk, de un buzón compartido, de un repositorio de documentos o de una base de datos
  • ¿Adónde va el resultado? A los campos y pantallas que el personal ya usa, como una sugerencia que puede aceptar o cambiar, no a una herramienta nueva que tiene que acordarse de abrir
  • ¿Qué puede tocar? Solo los datos y las acciones que la tarea necesita. Un modelo que clasifica tickets no necesita acceso a reembolsos ni a cuentas de clientes
  • ¿Cómo se apaga? Un solo interruptor que devuelve el trabajo al modo manual, en manos de la persona responsable del sistema

Empieza con una tarea en un sistema. Al principio el modelo sugiere y una persona decide. El modelo solo puede actuar por su cuenta en las partes en las que acierta una y otra vez con trabajo real, y el modo manual se mantiene como respaldo.

Al sistema deberían darle forma las personas que hoy hacen el trabajo. Saben qué documentos son difíciles, qué respuestas son erróneas y dónde un error cuesta dinero. También son quienes revisarán las respuestas en los primeros meses, así que su tiempo tiene que estar en el plan.

¿Qué tiene que decidir la empresa antes de contratar a nadie?

Antes de que nadie construya un sistema de IA para ti, responde por escrito a siete preguntas. Ninguna requiere formación técnica, y cada respuesta cambia lo que hay que construir:

  • ¿Qué tarea, en qué sistema? Nombra una tarea en una frase, como «clasificar los tickets entrantes del helpdesk por equipo y urgencia»
  • ¿Cómo es un resultado correcto? Reúne ejemplos reales con la respuesta correcta, escrita por las personas que hoy hacen el trabajo
  • ¿Qué datos verá el modelo y adónde pueden ir esos datos? Pide a tu responsable legal, de riesgos o de protección de datos que lo ponga por escrito para cada tipo de dato
  • ¿Cuánto trabajo y cuándo? El número de documentos o tickets al día y la hora de más carga
  • ¿Quién revisa las respuestas? Al principio una persona revisa cada respuesta. Di quién y cuántas horas a la semana le lleva
  • ¿Qué pasa cuando la IA no está disponible? El trabajo vuelve a las personas y espera, en lugar de perderse
  • ¿Quién lo opera tras el lanzamiento y qué será tuyo? Tu propio equipo o quien lo construya, con un contrato de soporte; y al final, el código, los ejemplos y la documentación

Las respuestas por escrito a estas siete preguntas son tu brief. Entregadas a tres empresas que se ofrecen a construirlo, dan tres propuestas que puedes comparar. Sin ellas, recibes tres demostraciones de una ventana de chat.

Nuestro piloto de IA funciona en una demo pero nunca llegó a producción. ¿Quién puede ayudarnos a terminarlo?

Una demo responde a una sola pregunta: ¿puede el modelo hacer la tarea con buenos ejemplos? El uso diario añade cuatro más, y un piloto que se atasca normalmente se las ha saltado:

  • ¿Qué cuenta como correcto? Un conjunto de ejemplos reales con respuestas acordadas y un umbral mínimo que el sistema tiene que alcanzar
  • ¿Esos datos pueden ir ahí? Un piloto construido sobre un servicio de IA externo no se traslada sin más a datos que deben quedarse en tus servidores; un modelo que operas tú mismo tiene que probarse de nuevo
  • ¿Adónde van las respuestas erróneas? A un lugar donde una persona las ve y las corrige antes de que otro sistema las use
  • ¿Quién es el responsable? Una persona o un equipo concretos que operan el sistema, vigilan sus respuestas y a quienes se llama cuando se detiene

Terminar un piloto atascado suele significar construir estas cuatro cosas alrededor del modelo, no comprar un modelo mejor. Un artículo anterior de este blog, sobre el piloto de IA que nunca llegó a producción, explica cada una con más profundidad.

Cualquier equipo que se haga cargo de un piloto atascado necesita tres cosas de ti: los ejemplos del piloto, los documentos en los que falló y el nombre de la persona que será responsable del sistema. Un equipo que no pide ninguna de ellas está planeando una nueva demo.

¿Cuánto cuesta operar un LLM en tus propios servidores?

Este artículo no da precios. «Un sistema de IA en nuestros propios servidores» abarca proyectos cuyo tamaño varía muchas veces, y una cifra dada antes de que alguien haya escuchado tus respuestas a las siete preguntas anteriores es una cifra comercial, no una estimación.

Lo útil es conocer los tipos de coste, porque la mayoría dependen de decisiones que controlas tú:

  • Hardware o capacidad en la nube. Servidores con GPU, comprados o alquilados, dimensionados para tu hora de más carga y no para la media
  • Conexiones con tus sistemas. Cada sistema del que el modelo lee o en el que escribe es un trabajo aparte, con sus propios permisos y registros
  • El tiempo de tu gente. El personal que reúne los ejemplos, escribe las respuestas correctas y revisa las respuestas del modelo en los primeros meses
  • Corregir respuestas erróneas. Horas de alguien cada semana, mientras el sistema siga funcionando
  • Operarlo. Actualizaciones de seguridad, vigilar las respuestas además de los servidores, y alguien a quien se llama cuando se detiene
  • Cambiar de modelo. Un modelo más nuevo se prueba con tus ejemplos antes de sustituir al anterior, y la prueba se repite con cada cambio

El coste sigue un patrón distinto al del servicio de un proveedor. Un proveedor cobra por la cantidad de texto que el modelo lee y escribe. Los servidores que tienes en propiedad, o que alquilas por meses, cuestan más o menos lo mismo tanto si están ocupados como si están parados, así que el volumen de trabajo decide qué opción te sale más barata.

El alcance es la parte del coste que controlas más directamente. Una tarea, en un sistema, para un equipo es la primera versión más pequeña que aún muestra si merece la pena ampliar el sistema.

¿Quién construye sistemas de IA que funcionan dentro de la propia infraestructura de una empresa, y cómo los evalúo?

Cuando una empresa dice «queremos IA en nuestros propios servidores», responden cuatro tipos de proveedor:

  • Proveedores de software. Venden un producto de IA listo para instalar, como un asistente de chat para el personal. Encaja bien para un asistente general, y peor cuando la tarea depende de tus propios sistemas y normas
  • Proveedores de nube y sus socios. Venden modelos como servicio gestionado, en el que tu texto sale de tu cuenta, y ofrecen herramientas para ejecutar modelos de pesos abiertos dentro de tu propia cuenta en la nube. Algunos ofrecen ayuda para conectarlos
  • Empresas de ingeniería. Construyen la conexión entre un modelo y tus sistemas según tus especificaciones, y el contrato decide qué parte pasa a ser tuya
  • Tu propio equipo. A veces con ingenieros externos que se suman para la primera versión

Antes que nada, pide a cualquier proveedor estas pruebas:

  • Un sistema de IA que hayan llevado a producción dentro de la infraestructura de un cliente, con el cliente nombrado cuando este lo permita
  • Qué hace ese sistema, en una frase, y quién lo opera hoy
  • Qué pasa en ese sistema cuando el modelo da una respuesta errónea
  • Una demostración con documentos o tickets reales, no con ejemplos preparados
  • Adónde fueron los datos durante su trabajo: si algo, incluidos los logs y las copias de prueba, salió de los servidores del cliente
  • Qué entregarán: el código, los ejemplos, la configuración y la documentación, y si algo sigue siendo suyo

Después escucha lo que te pregunta el proveedor. Una empresa que ya ha construido esto pregunta antes de dar un presupuesto:

  • Qué tarea, en qué sistema y quién la hace hoy
  • Qué datos verá el modelo y qué permiten tus normas con ellos
  • Si tienes ejemplos reales con las respuestas correctas y quién puede escribir más
  • Quién revisará las respuestas y quién será responsable del sistema un año después del lanzamiento

Una prueba rápida para cualquier proveedor de IA: pregunta qué pasa con un documento o un ticket en el que el modelo se equivoca. Un proveedor que ya ha construido esto responde con adónde va la respuesta errónea y quién la corrige. Uno que no lo ha hecho responde con el nombre de un modelo.

¿Ha llevado amBrain un modelo de lenguaje a producción?

De los tipos de proveedor descritos arriba, amBrain es una empresa de ingeniería.

Lo que amBrain puede decir públicamente sobre su propio trabajo con modelos de lenguaje, en su totalidad: Hemos llevado a producción una integración de LLM dentro del perímetro FinTech de un cliente: extracción y normalización de avisos no estructurados de brókers y de centros de negociación —eventos corporativos, cambios de instrumentos y de márgenes— en registros estructurados que consume el sistema de trading.

El cliente no se nombra, no se revela dónde se ejecutó el modelo en ese proyecto y no se dan cifras sobre ese proyecto. Este artículo no es un caso de estudio sobre él. Explica cómo planificar y elegir, y no afirma que amBrain haya construido un sistema de tickets de soporte, un asistente para el personal ni ningún sistema interno de IA aparte de la extracción de avisos mencionada arriba.

Más allá de esa integración: amBrain lleva construyendo software desde 2019. Trabajamos en tres formatos: entrega completa, un equipo dedicado o ingenieros integrados en tu equipo. El cliente conserva la propiedad completa del producto y del código, salvo nuestros componentes reutilizables.

Si estás al principio, el siguiente paso útil no es buscar proveedor. Es una página con respuestas por escrito a las siete preguntas de este artículo. Entrega la misma página a cada empresa con la que hables para construirlo, a nosotros o a cualquier otra, y sus propuestas se podrán comparar línea por línea.

¿Tiene un diseño así sobre la mesa?

Traiga su arquitectura actual y el modo de fallo que le preocupa, y lo repasaremos juntos en media hora.