amBrain
FinTechOct 1, 202610 мин чтения

Приватный ChatGPT для вашей компании на собственных серверах: что для этого нужно и кто может его развернуть

Приватный ChatGPTAI на своих серверахОт пилота к продакшенуКто это строит
Ошибка загрузки изображения

Сотрудникам можно дать ассистента в духе ChatGPT так, чтобы данные клиентов не покидали компанию. Прежде чем им начнут пользоваться каждый день, тот, кто его разворачивает, должен показать вам, что ассистент соблюдает права доступа каждого человека к документам и хранит чаты и логи ровно столько, сколько решит ваша служба комплаенса.

Приватный ChatGPT — это чат-ассистент, который работает как ChatGPT, но запущен на серверах, которые контролирует ваша компания. Сотрудники входят в чат-приложение, которое отправляет их вопросы языковой модели на этих серверах, а поиск по вашим собственным документам позволяет модели отвечать на их основе. Каждая из этих частей уже сегодня существует в виде open-source или лицензируемого ПО.

Основная работа — связать эти части с корпоративным входом, правами доступа к документам и логами вашей компании, а затем эксплуатировать систему. Пробный запуск может организовать ваш ИТ-отдел. Прежде чем на систему станет полагаться каждый сотрудник, регулируемой компании стоит нанять команду, которая может показать каждое из перечисленных ниже требований в работе на собственных системах компании.

Короткий ответ: ваш ИТ-отдел может провести пробный запуск на документах, которые разрешено читать всем участникам пробной группы. Для ежедневной работы во всей компании нанимайте команду только после того, как она покажет ассистента в работе с вашим собственным входом и вашими документами. Ассистент должен скрывать документы, которые человек не может открыть, и хранить чаты и логи на ваших серверах в течение срока, который устанавливает ваша служба комплаенса.

Зачем компаниям приватный ChatGPT?

Сотрудники не ждут, пока работодатель даст им AI-инструменты. В Work Trend Index 2024 от Microsoft и LinkedIn — опросе 31 000 работников интеллектуального труда в 31 стране — 78% пользователей AI сказали, что приносят на работу собственные AI-инструменты.

В мае 2023 года Samsung временно ограничила использование инструментов генеративного AI на корпоративных устройствах и во внутренних сетях после того, как в апреле внутренние данные случайно утекли в ChatGPT. TechCrunch писал об опасениях Samsung, что данные на внешних серверах трудно «извлечь и удалить». Компания заявила, что «рассматривает меры по созданию защищённой среды для безопасного использования генеративного AI».

В опросе британских финансовых компаний, который Банк Англии и FCA опубликовали в ноябре 2024 года, защита данных и конфиденциальность оказались самым значимым регуляторным ограничением на использование AI, как его воспринимают сами компании.

Из чего состоит приватный ChatGPT?

«Приватный ChatGPT» — не название продукта OpenAI. Так называют систему, собранную из отдельных частей, и одной из них может быть модель от OpenAI — компании, которая стоит за ChatGPT. Названные ниже open-source проекты — примеры, которые могут встретиться вам в коммерческих предложениях, и рейтинга среди них эта статья не составляет. Вот эти части:

  • Чат-приложение — веб-страница, на которой сотрудники входят в систему, задают вопросы, загружают файлы и находят прошлые чаты. Один из open-source примеров — LibreChat под лицензией MIT. На странице проекта указан корпоративный вход через OAuth2 и LDAP — два распространённых способа подключить приложение к учётным записям, которые у сотрудников уже есть. LibreChat также работает с любым сервером модели, который принимает запросы в формате собственного сервиса OpenAI, — это называют OpenAI-совместимым API
  • Сервер модели запускает языковую модель на вашем оборудовании и отвечает на запросы чат-приложения. Open-source пример — vLLM. В его документации сказано, что он «реализует Completions API, Chat API и другие API OpenAI», поэтому чат-приложение, написанное под сервис OpenAI, может отправлять свои вопросы не в сервис OpenAI, а на ваш сервер
  • Модель — это набор файлов, называемых весами, которые загружает сервер. Модель с открытыми весами может скачать и запустить кто угодно — на условиях лицензии этой модели. Например, gpt-oss-120b от OpenAI опубликована под лицензией Apache 2.0, и, по словам OpenAI, она помещается на один графический процессор (GPU) на 80 ГБ, такой как NVIDIA H100
  • Поиск по документам позволяет ассистенту отвечать на основе ваших собственных политик и договоров. Документы разбиваются на фрагменты и хранятся в поисковом индексе, а фрагменты, подходящие к вопросу, передаются модели вместе с ним. Инженеры называют это retrieval-augmented generation, или RAG
  • Вход должен идти через корпоративные аккаунты, которыми сотрудники уже пользуются, чтобы при закрытии аккаунта сотрудника прекращался и его доступ к ассистенту
  • История чатов и логи фиксируют, кто что спросил и когда и что ответил ассистент. И то и другое — копии ваших данных
  • Настройки администратора определяют, кто какой моделью может пользоваться, по каким коллекциям документов может искать каждая группа, можно ли загружать файлы и как долго хранятся чаты

Лицензии становятся важны, когда системой пользуется вся компания. Open WebUI — ещё одно чат-приложение с открытым кодом — поставляется с корпоративным входом, группами пользователей и встроенным поиском по документам. Начиная с версии 0.6.6 (апрель 2025 года) его лицензия требует, чтобы название и логотип Open WebUI оставались видимыми, если у развёртывания больше 50 пользователей за 30-дневный период. Это требование снимает корпоративная лицензия, а также письменное разрешение проекта для участника, внёсшего существенный вклад. По словам проекта, из-за этого условия его лицензия не соответствовала бы критериям open source, установленным Open Source Initiative.

Исключает ли «собственная инфраструктура» ChatGPT Enterprise или Microsoft Copilot?

Да, если под «собственной» понимаются серверы, которые контролирует ваша компания: серверы ChatGPT Enterprise эксплуатирует OpenAI, а серверы Copilot — Microsoft. Если ваша служба комплаенса допускает хранение данных у провайдера по договору, оба варианта могут остаться в списке. Модель, на которой построен корпоративный ассистент, может работать в одном из трёх мест, и только третье держит каждый промпт и каждый файл на серверах под вашим контролем:

  • При бизнес-тарифе провайдера, таком как ChatGPT Enterprise или Microsoft Copilot, серверы эксплуатирует провайдер, а на ваши данные распространяется его договор. Документация ChatGPT от OpenAI, прочитанная в октябре 2026 года, описывает для рабочих пространств Enterprise резидентность данных (data residency) и резидентность инференса (inference residency). Они привязывают к выбранному региону то, где хранятся данные и где работает модель, и, как сказано в документации, обе «распространяются только на подходящий контент и поддерживаемые рабочие нагрузки». Там же добавлено, что «часть обработки или синхронизированные индексы могут подчиняться отдельным правилам размещения»
  • Облачные провайдеры тоже продают сервисы моделей, например Azure OpenAI и Amazon Bedrock, которые запускают модель в дата-центрах провайдера. Ваше чат-приложение может находиться в вашем собственном облачном аккаунте, но каждый вопрос вместе с приложенными к нему фрагментами документов уходит в этот сервис
  • Модель с открытыми весами может работать на серверах, которые эксплуатируете вы, — в вашем собственном дата-центре или на виртуальных машинах в вашем облачном аккаунте. Тогда промпты, загруженные файлы и логи остаются в системах под вашим контролем, а серверы и безопасность модели становятся вашей работой или работой команды, которую вы наймёте

Подробнее об этом — в статьях о том, как добавить языковую модель в ваши собственные системы и как запустить её в закрытом периметре; ссылки на обе есть выше. Они сравнивают сервис провайдера, облачный сервис и серверы, которые эксплуатируете вы. Страницы, ссылки на которые есть внизу этой страницы, посвящены стоимости и двум облачным сервисам.

Чем пробный запуск отличается от ассистента, которым сотрудники пользуются каждый день?

Пробный запуск показывает, находят ли люди ответы полезными. Ежедневная работа в регулируемой компании добавляет шесть требований, и исполнитель должен уметь до запуска показать каждое из них в работе:

  • Каждый человек видит только те документы, которые он и так может открыть. Microsoft устанавливает это правило для собственного ассистента: по словам компании, Copilot «показывает только те данные организации, на которые у конкретного пользователя есть как минимум права на просмотр». OWASP Top 10 for LLM Applications — список основных рисков безопасности в ПО на языковых моделях — рекомендует «векторные хранилища и хранилища эмбеддингов с учётом прав доступа». Это значит, что поисковый индекс должен хранить, кто может читать каждый фрагмент
  • Документы считаются недоверенным входом, потому что файл может нести скрытые инструкции. В одном из примеров OWASP в резюме есть белый текст на белом фоне, который велит системе рекомендовать кандидата, и модель выполняет это указание, когда кто-то позже спрашивает об этом кандидате. OWASP добавляет, что опора на ваши собственные документы призвана сделать ответы точнее, но, как показывают исследования, полностью от таких атак она не защищает. Поэтому ассистент должен только писать ответы, а любое действие в другой системе, например отправка письма, должно ждать одобрения человека
  • Чаты, загрузки и логи хранятся на ваших серверах в течение срока, который устанавливает ваша служба комплаенса. Microsoft позволяет администраторам с помощью инструментов комплаенса Purview «задавать политики хранения для данных, связанных с чат-взаимодействиями с Copilot». Приватному ассистенту нужен такой же контроль над базой данных чатов, загруженными файлами, поисковым индексом и логами сервера модели, в которых может оказаться полный текст вопросов. Ваша служба комплаенса должна иметь возможность прочитать, кто что спрашивал, не обращаясь к инженеру
  • После каждого изменения заново прогоняется набор ваших собственных вопросов, у каждого из которых есть правильный ответ. Вопросы пишут люди, которые знают ответы, — на материале своей реальной работы. Изменение здесь — это новая модель, новые инструкции для модели или крупная партия новых документов. Как собрать такой набор, объясняет статья о пилоте, ссылка на которую есть выше
  • Мощности рассчитаны на самый загруженный час, потому что пробный запуск для небольшой группы мало что говорит о том утре, когда вопросы одновременно задаёт значительная часть офиса. Ollama — инструмент для запуска модели на одной машине. В октябре 2026 года его документация указывала по умолчанию один запрос за раз для каждой модели, а следующие запросы ждали в очереди. Сравнение vLLM и Ollama, ссылка на которое есть внизу этой страницы, объясняет, как каждый из них справляется с тем, что вопросы задают сразу многие
  • У ассистента есть конкретный владелец, который может отключить его или вернуть предыдущую модель и настройки, не дожидаясь подрядчика. Сотрудники знают, куда сообщать о неверном ответе

Кто может развернуть приватный ChatGPT на наших собственных серверах?

Развернуть его могут ваш собственный ИТ-отдел, вендор или инженерная команда. Кто подойдёт, зависит от того, сколько людей будет пользоваться ассистентом и к чему его нужно подключить.

Для пробного запуска с небольшой группой ИТ-отдел, который уже обслуживает Linux-серверы, может установить open-source чат-приложение и сервер модели и загрузить модель с открытыми весами. Для начала может хватить модели поменьше: по словам OpenAI, её gpt-oss-20b работает в пределах 16 ГБ памяти. Сначала прочитайте все лицензии, включая лицензию чат-приложения, и ограничьте пробный запуск документами, которые разрешено читать всем в группе, чтобы права доступа пока не имели значения.

Коробочный продукт, который вендор продаёт как ПО для установки на ваших собственных серверах, может подойти для простого чата по общей библиотеке документов. Спросите, к каким из ваших систем он подключается и кто устанавливает его обновления, и проведите его через пять демонстраций из следующего раздела — так же, как заказную разработку.

Инженерная команда нужна, когда ассистент должен работать с вашим корпоративным входом и правами доступа нескольких систем. То же самое — когда его нужно подключить к другим системам, например к системе управления документами, или когда он должен вести логи, которые может читать ваша служба комплаенса. Такой командой может быть внешняя компания или инженеры, которые войдут в ваш ИТ-отдел. До начала работы договоритесь, кто будет эксплуатировать систему после запуска.

Как проверить компанию, которая предлагает его развернуть?

До подписания договора попросите каждого подрядчика о пяти демонстрациях. По возможности используйте тестовую установку с вашим собственным корпоративным входом и документами, которые вам разрешено показывать подрядчику:

  • Войдите под учётной записью человека, которому нельзя открывать определённый документ, и спросите о нём. Ассистент должен отвечать так, будто этого документа не существует. Затем отзовите у коллеги доступ к файлу в исходной системе и засеките, сколько времени пройдёт, прежде чем ассистент перестанет использовать этот файл для этого коллеги
  • Пусть подрядчик покажет, где хранятся чаты, загрузки и логи, и у вас на глазах удалит историю одного человека. Затем выясните, что остаётся в бэкапах и логах и когда это удаляется
  • Посмотрите набор тестовых вопросов, который подрядчик заново прогоняет после обновления модели, и запись о его последнем прогоне, и выясните, кто писал правильные ответы
  • Спросите, на сколько одновременных пользователей рассчитана система, и посмотрите нагрузочный тест, на котором основана эта цифра. В тесте должны использоваться вопросы и документы, похожие на ваши, при том числе пользователей, которое вы ожидаете в самый загруженный час
  • Проверьте, что вы смогли бы эксплуатировать систему без подрядчика. Вам должны передать код, конфигурацию, файлы модели, тестовые вопросы и инструкции по эксплуатации, и ничто не должно зависеть от серверов или лицензионных ключей подрядчика

Где здесь место amBrain?

О собственной работе с языковыми моделями amBrain говорит: «Мы вывели интеграцию LLM в прод внутри FinTech-периметра клиента: извлечение и нормализация неструктурированных уведомлений брокеров и торговых площадок — о корпоративных действиях, изменениях по инструментам и марже — в структурированные записи, которые потребляет торговая система». Клиент не называется, и никаких цифр по проекту не публикуется.

Эта статья — не кейс. Она не говорит, где работала модель в том проекте, и не утверждает, что amBrain построил приватный ChatGPT, ассистента для сотрудников или поиск по документам для какого-либо клиента. Цен и сроков она не приводит.

amBrain делает софт с 2019 года. amBrain работает в трёх форматах: полная разработка, выделенная команда или инженеры внутри вашей команды. Клиент сохраняет полное владение продуктом и кодом, кроме переиспользуемых компонентов amBrain.

Напишите одну страницу о том, какой из трёх описанных выше случаев подходит вам. Для каждого из шести требований добавьте, что оно значит в вашей компании, например в каких системах хранятся права доступа к документам и как долго нужно хранить чаты. Отправьте эту страницу в amBrain или любой другой команде из вашего списка и попросите каждую команду об одних и тех же пяти демонстрациях.

Частые вопросы

  • Будет ли он так же хорош, как ChatGPT? Этого никто не скажет, пока его не проверят на вашей собственной работе. Прогоните свой набор вопросов через каждую модель, которую рассматриваете, и попросите людей, знающих ответы, оценить результаты. Для сравнения с публичным сервисом используйте вопросы, в которых нет данных клиентов
  • Можно ли начать с модели провайдера, а позже перейти на собственные серверы? Да, если ваше чат-приложение обращается к модели через OpenAI-совместимый API. До переезда отправляйте провайдеру только те данные, которым ваша служба комплаенса разрешает покидать компанию. vLLM реализует тот же чат-API, поэтому приложению потом понадобятся только адрес вашего сервера и название модели — при условии, что оно не использует функций, которые есть только в сервисе провайдера. Прежде чем сотрудники переключатся, заново прогоните свои вопросы, потому что ответы меняются вместе с моделью, и спросите провайдера, как будут удалены данные, которые уже были ему отправлены
  • Могут ли сотрудники загружать собственные файлы? Да. Загрузка — это копия файла, которую хранит чат-приложение и которая иногда добавляется в поисковый индекс. Для неё нужен тот же срок хранения, что и для чатов, и удалять её нужно вместе с ними. Решите, остаётся ли загруженный файл только в чатах того, кто его загрузил, или им можно поделиться с группой

На столе похожая архитектура?

Принесите текущую архитектуру и тот сценарий отказа, который вас беспокоит, — разберём его вместе за полчаса.