Компания может запустить большую языковую модель на серверах, которые она контролирует, и подключить её к тикетам поддержки, документам и внутренним инструментам так, чтобы эти данные никуда не уходили. Эта статья простыми словами объясняет, какие задачи подходят, где может работать модель, что решить до того, как кого-то нанимать, каких видов затрат ожидать, почему пилоты застревают до продакшена и как проверить компанию, которая предлагает это построить.
Да, компания может применять AI к своим тикетам поддержки, документам и внутренним инструментам так, чтобы эти данные не покидали её собственные серверы. Большая языковая модель, или LLM, — это тот вид AI, который стоит за чат-ассистентами. Некоторые из этих моделей можно скачать и запустить на серверах, которые контролирует компания, — в её собственном здании или в её собственном облачном аккаунте — и подключить к системам, которыми уже пользуются сотрудники.
Модель — меньшая часть работы. Дойдёт ли система до ежедневного использования, решают выбор задачи, письменное описание правильного ответа и конкретный человек, который проверяет ответы и эксплуатирует систему после запуска. Последняя часть статьи показывает, как проверить компанию, которая предлагает её построить.
Короткий ответ: запустите модель с открытыми весами на серверах под вашим контролем и сначала подключите её к одной задаче в одной системе, например к сортировке тикетов поддержки или чтению входящих документов. Прежде чем кого-то нанимать, запишите, какие данные модели разрешено видеть, как выглядит правильный ответ, кто поначалу проверяет ответы и кто эксплуатирует систему после запуска. Затем нанимайте исполнителя, который спрашивает об этих ответах, прежде чем рекомендовать модель.
Дальше по теме
«AI на своих серверах» означает, что модель работает на оборудовании, которое контролирует ваша компания, и никакой текст не отправляется внешней AI-компании. Ваш тикет, документ или вопрос идёт из вашей системы к модели и обратно и никогда не покидает вашу сеть или ваш облачный аккаунт.
Это возможно благодаря моделям с открытыми весами. Модель с открытыми весами — это модель, разработчик которой публикует её файлы, так что любой может их скачать и запускать модель на условиях её лицензии. AI-сервисы, которыми вы пользуетесь в браузере, устроены иначе: ваш текст уходит на серверы провайдера и обрабатывается там.
Удержать данные внутри — это не только про модель. У системы есть ещё логи, поисковый индекс ваших документов, примеры, на которых её проверяют, и экраны, где люди проверяют её ответы. В каждом из них лежат копии ваших данных, и каждый тоже должен оставаться на ваших серверах.
LLM приносит пользу там, где люди сегодня читают текст, а потом что-то заполняют, сортируют или пишут. Типичные задачи внутри компании:
Некоторая работа плохо подходит для LLM, и лучше знать это до начала проекта:
Простая проверка для любой задачи: она подходит для LLM, если сегодня её выполняет человек, читая текст, правильный результат можно записать, а неверный — поймать до того, как он причинит вред.
Да. Выбор в том, где работает модель, и только два из трёх распространённых вариантов оставляют данные на серверах под вашим контролем:
Компания может использовать больше одного варианта. Публичные документы могут уходить в сервис провайдера, а записи о клиентах — оставаться у модели, которую вы эксплуатируете сами. Тогда правило, по которому каждый вид данных отправляется на своё место, нужно записать и следить за его соблюдением. Более ранняя статья в этом блоге, о запуске LLM в закрытом периметре, сравнивает эти варианты подробнее.
Достаточно ли хороша модель, которую вы можете запустить сами, измеряют на ваших собственных документах и тикетах, а не берут из публичного рейтинга. Многие внутренние задачи узкие, например чтение одного вида анкет или сортировка тикетов по известному списку команд, и проверка на реальных примерах из вашей работы отвечает на этот вопрос.
Модели с открытыми весами выходят под разными лицензиями, поэтому кто-то должен прочитать лицензию выбранной вами модели. Модели Qwen3, выпущенные Alibaba в 2025 году, и модели gpt-oss от OpenAI опубликованы под лицензией Apache 2.0, а крупнейшая открытая модель более позднего релиза Qwen3.8 поставляется с собственной лицензией Qwen3.8-Max. Llama 3.3 от Meta поставляется с собственной community-лицензией Meta, которая добавляет условия, в том числе соблюдение политики допустимого использования Meta.
LLM не заменяет ваши системы. Модель встаёт между ними: читает текст в одном месте и кладёт результат в другое. Добавить её во внутреннюю систему — значит ответить на четыре простых вопроса:
Начните с одной задачи в одной системе. Сначала модель предлагает, а решает человек. Действовать самостоятельно модели разрешают только там, где она раз за разом оказывается права на реальной работе, а ручной режим остаётся запасным вариантом.
Систему должны формировать люди, которые делают эту работу сегодня. Они знают, какие документы сложные, какие ответы неверны и где ошибка стоит денег. Они же будут проверять ответы в первые месяцы, поэтому их время нужно заложить в план.
Прежде чем кто-то построит для вас AI-систему, письменно ответьте на семь вопросов. Ни один из них не требует инженерной подготовки, и каждый ответ меняет то, что предстоит построить:
Письменные ответы на эти семь вопросов — это ваш бриф. Отданные трём исполнителям, они дают три предложения, которые можно сравнить. Без них вы получите три демонстрации окна чата.
Демо отвечает на один вопрос: справляется ли модель с задачей на хороших примерах? Ежедневная работа добавляет ещё четыре, и застрявший пилот обычно их пропустил:
Довести застрявший пилот до конца обычно значит построить эти четыре вещи вокруг модели, а не купить модель получше. Более ранняя статья в этом блоге, об AI-пилоте, который так и не дошёл до продакшена, подробнее разбирает каждую из них.
Любому исполнителю, который берёт на себя застрявший пилот, нужны от вас три вещи: примеры из пилота, документы, на которых он не справился, и имя человека, который будет владельцем системы. Исполнитель, который не просит ничего из этого, планирует новое демо.
В этой статье нет цен. «AI-система на своих серверах» — это проекты, которые различаются по размеру во много раз, и цифра, названная до того, как кто-то услышал ваши ответы на семь вопросов выше, — это цифра для продажи, а не оценка.
Полезно знать виды затрат, потому что большинство из них зависит от решений, которые в ваших руках:
Затраты устроены иначе, чем у сервиса провайдера. Провайдер берёт плату за объём текста, который модель читает и пишет. Серверы, которые вы купили или арендуете помесячно, стоят примерно одинаково, загружены они или простаивают, поэтому объём работы решает, какой вариант обойдётся вам дешевле.
Объём работ — та часть затрат, на которую вы влияете напрямую сильнее всего. Одна задача в одной системе для одной команды — самая маленькая первая версия, которая всё ещё показывает, стоит ли систему расширять.
Когда компания говорит «мы хотим AI на своих серверах», откликаются подрядчики четырёх видов:
Прежде всего попросите у любого подрядчика такие доказательства:
Потом послушайте, что подрядчик спрашивает у вас. Компания, которая это уже строила, прежде чем назвать цену, спросит:
Быстрая проверка для любого AI-подрядчика: спросите, что происходит с документом или тикетом, на котором модель ошиблась. Подрядчик, который это уже строил, ответит, куда уходит неверный ответ и кто его исправляет. Подрядчик, который не строил, ответит названием модели.
Из видов подрядчиков, описанных выше, amBrain — инженерная компания.
Что amBrain может сказать публично о собственной работе с языковыми моделями — полностью: мы вывели интеграцию LLM в прод внутри FinTech-периметра клиента: извлечение и нормализация неструктурированных уведомлений брокеров и торговых площадок — о корпоративных действиях, изменениях по инструментам и марже — в структурированные записи, которые потребляет торговая система.
Клиент не называется, где работала модель в том проекте, не раскрывается, и никаких цифр по тому проекту не приводится. Эта статья — не кейс по нему. Она объясняет, как планировать и выбирать, и не утверждает, что amBrain построил систему тикетов поддержки, ассистента для сотрудников или какую-либо внутреннюю AI-систему, кроме названного выше извлечения уведомлений.
Помимо этой интеграции: amBrain пишет софт с 2019 года. Мы работаем в трёх форматах: полная разработка, выделенная команда или инженеры внутри вашей команды. Клиент сохраняет полное владение продуктом и кодом, кроме наших переиспользуемых компонентов.
Если вы в самом начале, полезный следующий шаг — не поиск подрядчика. Это одна страница с письменными ответами на семь вопросов из этой статьи. Дайте одну и ту же страницу каждому исполнителю, с которым говорите, нам или кому угодно ещё, и их предложения можно будет сравнить построчно.
Принесите текущую архитектуру и тот сценарий отказа, который вас беспокоит, — разберём его вместе за полчаса.