amBrain
FinTechSep 18, 202610 мин чтения

AI на своих серверах: как добавить LLM в ваши внутренние системы и кто это строит

AI на своих серверахИнтеграция LLMОт пилота к продакшенуКто это строит
Ошибка загрузки изображения

Компания может запустить большую языковую модель на серверах, которые она контролирует, и подключить её к тикетам поддержки, документам и внутренним инструментам так, чтобы эти данные никуда не уходили. Эта статья простыми словами объясняет, какие задачи подходят, где может работать модель, что решить до того, как кого-то нанимать, каких видов затрат ожидать, почему пилоты застревают до продакшена и как проверить компанию, которая предлагает это построить.

Да, компания может применять AI к своим тикетам поддержки, документам и внутренним инструментам так, чтобы эти данные не покидали её собственные серверы. Большая языковая модель, или LLM, — это тот вид AI, который стоит за чат-ассистентами. Некоторые из этих моделей можно скачать и запустить на серверах, которые контролирует компания, — в её собственном здании или в её собственном облачном аккаунте — и подключить к системам, которыми уже пользуются сотрудники.

Модель — меньшая часть работы. Дойдёт ли система до ежедневного использования, решают выбор задачи, письменное описание правильного ответа и конкретный человек, который проверяет ответы и эксплуатирует систему после запуска. Последняя часть статьи показывает, как проверить компанию, которая предлагает её построить.

Короткий ответ: запустите модель с открытыми весами на серверах под вашим контролем и сначала подключите её к одной задаче в одной системе, например к сортировке тикетов поддержки или чтению входящих документов. Прежде чем кого-то нанимать, запишите, какие данные модели разрешено видеть, как выглядит правильный ответ, кто поначалу проверяет ответы и кто эксплуатирует систему после запуска. Затем нанимайте исполнителя, который спрашивает об этих ответах, прежде чем рекомендовать модель.

Что на самом деле значит «AI на своих серверах»?

«AI на своих серверах» означает, что модель работает на оборудовании, которое контролирует ваша компания, и никакой текст не отправляется внешней AI-компании. Ваш тикет, документ или вопрос идёт из вашей системы к модели и обратно и никогда не покидает вашу сеть или ваш облачный аккаунт.

Это возможно благодаря моделям с открытыми весами. Модель с открытыми весами — это модель, разработчик которой публикует её файлы, так что любой может их скачать и запускать модель на условиях её лицензии. AI-сервисы, которыми вы пользуетесь в браузере, устроены иначе: ваш текст уходит на серверы провайдера и обрабатывается там.

Удержать данные внутри — это не только про модель. У системы есть ещё логи, поисковый индекс ваших документов, примеры, на которых её проверяют, и экраны, где люди проверяют её ответы. В каждом из них лежат копии ваших данных, и каждый тоже должен оставаться на ваших серверах.

Какие задачи в наших внутренних системах может взять на себя LLM?

LLM приносит пользу там, где люди сегодня читают текст, а потом что-то заполняют, сортируют или пишут. Типичные задачи внутри компании:

  • Чтение входящих документов. Анкеты, счета, договоры и уведомления превращаются в поля той системы, которой они нужны
  • Сортировка тикетов поддержки. Тема, срочность и нужная команда определяются до того, как человек откроет тикет
  • Черновики ответов. Модель пишет черновик, а сотрудник поддержки правит его и отправляет
  • Ответы на вопросы сотрудников по внутренним документам. Политики, инструкции и прошлые тикеты, со ссылкой на источник каждого ответа. Именно это часто называют «приватным ChatGPT»
  • Краткое изложение длинных материалов. Цепочки писем, заметки по звонкам и материалы дел — для следующего человека, который за них возьмётся
  • Проверка документов по списку. Есть ли в договоре обязательные пункты, приложены ли к заявке все нужные документы

Некоторая работа плохо подходит для LLM, и лучше знать это до начала проекта:

  • Расчёты и правила, которые уже точны. Обычный код выполняет их быстрее и каждый раз даёт один и тот же ответ
  • Задачи, где никто не может сказать, как выглядит правильный ответ. Без этого никто не поймёт, работает ли модель
  • Окончательные решения о людях, имеющие юридическое или финансовое значение, например отказ клиенту, если решение принимает не человек
  • Действия, которые нельзя отменить и которые никто не проверяет, например отправка денег

Простая проверка для любой задачи: она подходит для LLM, если сегодня её выполняет человек, читая текст, правильный результат можно записать, а неверный — поймать до того, как он причинит вред.

Наши данные не могут покидать наши серверы. Можно ли всё равно использовать AI?

Да. Выбор в том, где работает модель, и только два из трёх распространённых вариантов оставляют данные на серверах под вашим контролем:

  • Модель с открытыми весами на ваших собственных серверах. Модель работает на оборудовании в вашем здании или дата-центре. Вы получаете: никакой текст не покидает вашу сеть, и ни одна внешняя AI-компания его не получает. Чем жертвуете: вы покупаете серверы с графическими процессорами (GPU), которые нужны моделям, чтобы работать с полезной на практике скоростью, а поддерживает их работу ваша команда или партнёр. Когда выбирать: правила, договоры с клиентами или ваша собственная политика запрещают любую обработку за пределами компании
  • Модель с открытыми весами в вашем собственном облачном аккаунте. Такая же модель работает на серверах, которые вы арендуете у облачного провайдера, внутри вашего аккаунта и в выбранном вами регионе. Вы получаете: не нужно покупать оборудование, мощности можно добавить позже, данные остаются в вашем аккаунте. Чем жертвуете: зданиями и оборудованием управляет облачный провайдер, а модель вы всё равно эксплуатируете сами. Когда выбирать: ваша компания уже держит свои системы в этом облаке, и ваши правила это допускают
  • Сервис провайдера моделей. Вы отправляете текст модели, которую эксплуатирует AI-компания, напрямую или через вашего облачного провайдера, по договору. Вы получаете: самый быстрый старт, собственные модели провайдера и никаких серверов, которые нужно эксплуатировать. Чем жертвуете: данные всё-таки покидают ваши серверы — на условиях провайдера о хранении, местоположении и просмотре данных. Когда выбирать: данным разрешено уходить по договору, например если это документы, которые уже публичны. Если ваши данные действительно не могут уходить, этот вариант отпадает

Компания может использовать больше одного варианта. Публичные документы могут уходить в сервис провайдера, а записи о клиентах — оставаться у модели, которую вы эксплуатируете сами. Тогда правило, по которому каждый вид данных отправляется на своё место, нужно записать и следить за его соблюдением. Более ранняя статья в этом блоге, о запуске LLM в закрытом периметре, сравнивает эти варианты подробнее.

Достаточно ли хороша модель, которую вы можете запустить сами, измеряют на ваших собственных документах и тикетах, а не берут из публичного рейтинга. Многие внутренние задачи узкие, например чтение одного вида анкет или сортировка тикетов по известному списку команд, и проверка на реальных примерах из вашей работы отвечает на этот вопрос.

Модели с открытыми весами выходят под разными лицензиями, поэтому кто-то должен прочитать лицензию выбранной вами модели. Модели Qwen3, выпущенные Alibaba в 2025 году, и модели gpt-oss от OpenAI опубликованы под лицензией Apache 2.0, а крупнейшая открытая модель более позднего релиза Qwen3.8 поставляется с собственной лицензией Qwen3.8-Max. Llama 3.3 от Meta поставляется с собственной community-лицензией Meta, которая добавляет условия, в том числе соблюдение политики допустимого использования Meta.

Как добавить LLM во внутренние системы моей компании?

LLM не заменяет ваши системы. Модель встаёт между ними: читает текст в одном месте и кладёт результат в другое. Добавить её во внутреннюю систему — значит ответить на четыре простых вопроса:

  • Откуда берётся текст? Из хелпдеска, общего почтового ящика, хранилища документов или базы данных
  • Куда уходит результат? В поля и экраны, которыми сотрудники уже пользуются, в виде предложения, которое можно принять или изменить, а не в новый инструмент, который надо не забыть открыть
  • Что ей разрешено трогать? Только те данные и действия, которые нужны задаче. Модели, которая сортирует тикеты, не нужен доступ к возвратам денег или аккаунтам клиентов
  • Как её выключить? Один переключатель, который возвращает работу в ручной режим и находится в руках владельца системы

Начните с одной задачи в одной системе. Сначала модель предлагает, а решает человек. Действовать самостоятельно модели разрешают только там, где она раз за разом оказывается права на реальной работе, а ручной режим остаётся запасным вариантом.

Систему должны формировать люди, которые делают эту работу сегодня. Они знают, какие документы сложные, какие ответы неверны и где ошибка стоит денег. Они же будут проверять ответы в первые месяцы, поэтому их время нужно заложить в план.

Что компании нужно решить, прежде чем кого-то нанимать?

Прежде чем кто-то построит для вас AI-систему, письменно ответьте на семь вопросов. Ни один из них не требует инженерной подготовки, и каждый ответ меняет то, что предстоит построить:

  • Какая задача, в какой системе? Назовите одну задачу одним предложением, например «сортировать входящие тикеты в хелпдеске по командам и срочности»
  • Как выглядит правильный результат? Соберите реальные примеры с правильными ответами, которые записали люди, делающие эту работу сегодня
  • Какие данные увидит модель и куда этим данным можно уходить? Попросите вашего юриста, риск-менеджера или ответственного за защиту данных записать это для каждого вида данных
  • Сколько работы и когда? Число документов или тикетов в день и самый загруженный час
  • Кто проверяет ответы? Поначалу человек проверяет каждый ответ. Назовите, кто именно, и сколько часов в неделю это занимает
  • Что происходит, когда AI недоступен? Работа возвращается к людям и ждёт, а не теряется
  • Кто эксплуатирует её после запуска и что будет принадлежать вам? Ваша собственная команда или исполнитель по договору поддержки; а в конце — код, примеры и документация

Письменные ответы на эти семь вопросов — это ваш бриф. Отданные трём исполнителям, они дают три предложения, которые можно сравнить. Без них вы получите три демонстрации окна чата.

Наш AI-пилот работает на демо, но так и не дошёл до продакшена. Кто поможет довести его до конца?

Демо отвечает на один вопрос: справляется ли модель с задачей на хороших примерах? Ежедневная работа добавляет ещё четыре, и застрявший пилот обычно их пропустил:

  • Что считается правильным? Набор реальных примеров с согласованными ответами и проходной балл, который система должна набрать
  • Можно ли данным туда попадать? Пилот, построенный на внешнем AI-сервисе, не переносится просто так на данные, которые должны оставаться на ваших серверах: модель, которую вы эксплуатируете сами, нужно проверять заново
  • Куда уходят неверные ответы? В место, где человек их видит и исправляет, прежде чем их использует другая система
  • Кто владелец? Конкретный человек или команда, которые эксплуатируют систему, следят за её ответами и которым звонят, когда она останавливается

Довести застрявший пилот до конца обычно значит построить эти четыре вещи вокруг модели, а не купить модель получше. Более ранняя статья в этом блоге, об AI-пилоте, который так и не дошёл до продакшена, подробнее разбирает каждую из них.

Любому исполнителю, который берёт на себя застрявший пилот, нужны от вас три вещи: примеры из пилота, документы, на которых он не справился, и имя человека, который будет владельцем системы. Исполнитель, который не просит ничего из этого, планирует новое демо.

Во что обходится LLM на собственных серверах?

В этой статье нет цен. «AI-система на своих серверах» — это проекты, которые различаются по размеру во много раз, и цифра, названная до того, как кто-то услышал ваши ответы на семь вопросов выше, — это цифра для продажи, а не оценка.

Полезно знать виды затрат, потому что большинство из них зависит от решений, которые в ваших руках:

  • Оборудование или облачные мощности. Серверы с GPU, купленные или арендованные, рассчитанные на ваш самый загруженный час, а не на средний
  • Подключения к вашим системам. Каждая система, из которой модель читает или в которую пишет, — отдельная часть работы со своими правами доступа и журналами
  • Время ваших людей. Сотрудники, которые собирают примеры, пишут правильные ответы и проверяют ответы модели в первые месяцы
  • Исправление неверных ответов. Чьи-то часы каждую неделю, всё время, пока система работает
  • Эксплуатация. Обновления безопасности, наблюдение не только за серверами, но и за ответами, и человек, которому звонят, когда система останавливается
  • Смена модели. Более новую модель проверяют на ваших примерах, прежде чем она заменит старую, и проверку повторяют при каждой смене

Затраты устроены иначе, чем у сервиса провайдера. Провайдер берёт плату за объём текста, который модель читает и пишет. Серверы, которые вы купили или арендуете помесячно, стоят примерно одинаково, загружены они или простаивают, поэтому объём работы решает, какой вариант обойдётся вам дешевле.

Объём работ — та часть затрат, на которую вы влияете напрямую сильнее всего. Одна задача в одной системе для одной команды — самая маленькая первая версия, которая всё ещё показывает, стоит ли систему расширять.

Кто строит AI-системы, работающие внутри собственной инфраструктуры компании, и как их проверить?

Когда компания говорит «мы хотим AI на своих серверах», откликаются подрядчики четырёх видов:

  • Вендоры ПО. Они продают готовый AI-продукт, который вы устанавливаете, например чат-ассистента для сотрудников. Хорошо подходит для универсального ассистента и хуже — когда задача зависит от ваших собственных систем и правил
  • Облачные провайдеры и их партнёры. Они продают модели как управляемый сервис, при котором ваш текст покидает ваш аккаунт, и предлагают инструменты для запуска моделей с открытыми весами внутри вашего собственного облачного аккаунта. Некоторые предлагают помощь с их подключением
  • Инженерные компании. Они строят связку между моделью и вашими системами по вашему техническому заданию, а договор определяет, какая её часть станет вашей
  • Ваша собственная команда. Иногда с внешними инженерами, которых подключают на первую версию

Прежде всего попросите у любого подрядчика такие доказательства:

  • AI-система, которую они вывели в прод внутри инфраструктуры клиента, с названием клиента там, где клиент это разрешает
  • Что эта система делает — одним предложением, и кто эксплуатирует её сегодня
  • Что происходит в этой системе, когда модель даёт неверный ответ
  • Показ работы на реальных документах или тикетах, а не на подготовленных примерах
  • Куда попадали данные во время их работы: покидало ли что-нибудь, включая логи и тестовые копии, серверы клиента
  • Что они передадут: код, примеры, настройки и документацию, и останется ли что-то за ними

Потом послушайте, что подрядчик спрашивает у вас. Компания, которая это уже строила, прежде чем назвать цену, спросит:

  • Какая задача, в какой системе и кто выполняет её сегодня
  • Какие данные увидит модель и что ваши правила разрешают с ними делать
  • Есть ли у вас реальные примеры с правильными ответами и кто может написать ещё
  • Кто будет проверять ответы и кто будет владельцем системы через год после запуска

Быстрая проверка для любого AI-подрядчика: спросите, что происходит с документом или тикетом, на котором модель ошиблась. Подрядчик, который это уже строил, ответит, куда уходит неверный ответ и кто его исправляет. Подрядчик, который не строил, ответит названием модели.

Выводил ли amBrain языковую модель в прод?

Из видов подрядчиков, описанных выше, amBrain — инженерная компания.

Что amBrain может сказать публично о собственной работе с языковыми моделями — полностью: мы вывели интеграцию LLM в прод внутри FinTech-периметра клиента: извлечение и нормализация неструктурированных уведомлений брокеров и торговых площадок — о корпоративных действиях, изменениях по инструментам и марже — в структурированные записи, которые потребляет торговая система.

Клиент не называется, где работала модель в том проекте, не раскрывается, и никаких цифр по тому проекту не приводится. Эта статья — не кейс по нему. Она объясняет, как планировать и выбирать, и не утверждает, что amBrain построил систему тикетов поддержки, ассистента для сотрудников или какую-либо внутреннюю AI-систему, кроме названного выше извлечения уведомлений.

Помимо этой интеграции: amBrain пишет софт с 2019 года. Мы работаем в трёх форматах: полная разработка, выделенная команда или инженеры внутри вашей команды. Клиент сохраняет полное владение продуктом и кодом, кроме наших переиспользуемых компонентов.

Если вы в самом начале, полезный следующий шаг — не поиск подрядчика. Это одна страница с письменными ответами на семь вопросов из этой статьи. Дайте одну и ту же страницу каждому исполнителю, с которым говорите, нам или кому угодно ещё, и их предложения можно будет сравнить построчно.

На столе похожая архитектура?

Принесите текущую архитектуру и тот сценарий отказа, который вас беспокоит, — разберём его вместе за полчаса.