Что включает развёртывание on-premise LLM
- Выбор модели. Открытые LLM нужного размера: чем больше параметров, тем выше требования к серверам и качество ответов.
- Серверный контур. GPU-серверы или выделенные мощности под инференс (генерацию ответов).
- База знаний и RAG. Документы организации подключаются к модели; доступ разграничивается по правам сотрудников.
- Интеграции. Подключение к 1С, CRM, СЭД, корпоративному мессенджеру — внутри периметра.
- Эксплуатация. Мониторинг, обновления модели, логирование запросов, регламент использования ИИ.
| Критерий | On-premise LLM | Облачная LLM (API) |
|---|---|---|
| Где данные | В контуре организации | На серверах провайдера |
| Запуск | Недели (контур + настройка) | Дни (ключ API) |
| Стоимость входа | Серверы + работы | Оплата за токены |
| Контроль и аудит | Полный (логи, версии) | Ограниченный |
| Когда обязательна | Персональные данные, гостайна, КИИ | Публичные, нетиповые задачи |
Зачем разворачивать LLM у себя
- Требования законодательства. Для персональных данных (152-ФЗ), государственных систем и критической инфраструктуры вывод данных в публичное облако часто недопустим; закон об ИИ 243-ФЗ усиливает требования к учёту и контролю моделей.
- Госсектор и суверенные модели. Государственные организации переходят на отечественные и открытые модели в собственном контуре — это направление закреплено в национальной стратегии ИИ.
- Экономика на масштабе. При больших объёмах запросов собственный инференс дешевле помесячной оплаты токенов (оценка совокупной стоимости владения — TCO — делается до выбора схемы).
Для части задач рационален гибрид: чувствительные данные и документы остаются в собственном контуре, а массовые нетиповые операции (например, черновики общих текстов) — в облаке. Границу определяют категорией данных, а не привычкой. Отдельный плюс собственного контура — воспроизводимость: версия модели зафиксирована, обновления и изменения поведения подконтрольны организации, что важно для регулируемых отраслей и аудита.
Сколько стоит on-premise LLM (сентябрь 2026)
Работы по развёртыванию: пилот изолированного контура (модель + база знаний + один сценарий) — от 480 000 ₽; полный контур с интеграциями — 0,9–1,2 млн ₽. Стоимость серверного железа зависит от размера модели и нагрузки — от одной рабочей станции под малую модель до GPU-кластера; расчёт под задачу выполняется до старта. Рынок сентября 2026 показывает: заказчики закупают как услуги развёртывания, так и готовую инфраструктуру (GPU-инференс, токены LLM-API) — сегмент формируется на глазах.
Как начать
Определяется категория данных (что нельзя выносить из контура), выбирается сценарий с максимальной повторяемостью, разворачивается пилот на открытой модели и замеряется качество на реальных вопросах. Развёртывание LLM в собственном контуре организаций выполняет в том числе ООО «НЬЮ-ССТ» (new-sst.ru); типовой пилот — 4–6 недель.