Свой ИИ — когда облако не вариант
У облачных нейросетей два неудобных свойства: они чужие и они внешние. Чужие — значит, ваши данные обрабатываются на чужой инфраструктуре по чужим правилам. Внешние — значит, доступ зависит от канала связи, политики поставщика и географии. Для задач с персональными данными, медицинскими записями, кадровой документацией, гостайной или просто коммерческой тайной это не «особенность», а стоп-фактор: служба безопасности не согласует, юрист не благословит, проверяющий не поймёт.
Локальная LLM снимает вопрос архитектурно: модель физически работает на вашей инфраструктуре, запросы и документы циркулируют внутри периметра, доступ регулируется вашими политиками, а журнал — ваш. Современные open-source модели (Qwen, Llama, GPT-OSS и другие) решают типовые корпоративные задачи — ответы по базе знаний, обработка документов, ассистенты — в промышленном качестве, а при больших объёмах запросов собственный инференс оказывается дешевле оплаты токенов. Технологические основы — в наших материалах: «Ollama: локальный LLM», «Open-source LLM для бизнеса», «vLLM serving».
Когда нужна локальная LLM
- Персональные и чувствительные данные. Медицина, кадры, банки, госсектор: стандарт рынка для таких задач — закрытый контур, где запросы не покидают периметр. Требования 152-ФЗ выполняются «по построению», а не обещаниями вендора.
- Служба безопасности сказала «облака нельзя». Политики многих компаний запрещают отправку рабочих данных во внешние сервисы. Локальная модель — легальный путь дать сотрудникам ИИ, не ломая эти политики.
- Комплаенс по 243-ФЗ и 152-ФЗ. Управляемость ИИ: реестр, логи, границы тем, контроль качества — в собственном контуре всё это реализуется полноценно (см. аудит по 243-ФЗ).
- Большие объёмы запросов. Тысячи обращений в день на API — это счёт за токены, который растёт быстрее пользы. Свой инференс на vLLM при стабильной нагрузке обычно дешевле — это видно на расчёте TCO.
- Независимость от внешних сервисов. Ограничения доступа, изменения тарифов, отключения API — ваш контур работает, пока работает ваше железо.
- Специальные требования к моделям. Дообучение под свою предметку, свои правила тона и форматов, полный контроль версий модели — с локальной LLM всё это в ваших руках, без «универсального» поведения чужой модели.
Что делаем
Аудит и выбор модели
Сопоставляем задачи, железо и модели: какие open-source LLM вытянут ваши сценарии, какие нужны ресурсы, что даст квантование. Решение — по замерам на ваших данных, а не по хайпу.
Развёртывание и инфраструктура
Установка и настройка: vLLM для производительности, Kubernetes для оркестрации, квантование для экономии ресурсов. На вашем железе или в вашем сегменте ЦОД.
RAG по вашим документам
База знаний внутри контура: pgvector или Milvus/Qdrant, поиск и ответы со ссылками на документы. Подготовка данных — по гайду.
Интеграции внутри периметра
Подключаем ИИ к вашим системам: 1С, СЭД, интранет, внутренние сервисы (см. LLM-интеграции). Обмен данными — только внутри контура.
Безопасность и защита ИИ
Права доступа, ограничение тем, защита от промпт-инъекций и jailbreak (guardrails), логирование. ИИ-контур закрывается как любой ИТ-сервис с особым режимом.
Мониторинг и сопровождение
Контроль качества ответов, нагрузки и стоимости инференса, обновления моделей и зависимостей. Сопровождение — от 50 000 ₽/мес (см. MLOps).
Как проходит работа: этапы
- Разбор — бесплатно, 1 рабочий день. Присылаете описание задач и ограничений (какие данные, какие политики, какое железо есть). Возвращаемся с планом и вилкой цен.
- Аудит и выбор модели — от 90 000 ₽, 1–2 недели. Карта сценариев и данных, замеры моделей-кандидатов на ваших примерах, требования к железу, TCO против облачных API. Отчёт: какая модель, почему, сколько стоит владение.
- Пилот on-premise — от 480 000 ₽, 4–6 недель. Контур на вашем железе: модель + RAG по первому массиву документов, доступ для пилотной группы, замеры качества и скорости.
- Замеры и решение. Качество ответов и производительность против метрик, зафиксированных до старта. Если модель не дотягивает — меняем конфигурацию (модель/квантование/железо), а не «убеждаем себя».
- Промышленный контур — 0,9–1,2 млн ₽. Все пользователи и сценарии, резервирование, мониторинг, интеграции, документация, обучение команды и передача в эксплуатацию.
- Сопровождение — от 50 000 ₽/мес. Обновления моделей, контроль качества, развитие базы знаний и сценариев.
Технологии и подход
Модельный ряд — open-source LLM из числа актуальных (линейки Qwen, Llama, GPT-OSS и другие — обзор в «Open-source LLM для бизнеса»); для быстрого старта на умеренных нагрузках — Ollama, для промышленного инференса — vLLM; ускорение и удешевление — квантование GGUF/AWQ; память — pgvector. Если часть сценариев не чувствительна — строим гибрид: некритичное на российских API, чувствительное в контуре. Для связанных с персональными данными систем спланируем аттестацию с лицензированным соисполнителем (ИСПДн и 152-ФЗ).
Цены и сроки
| Ступень | Цена | Срок |
|---|---|---|
| Разбор задач и ограничений | бесплатно | 1 рабочий день |
| Аудит и выбор модели (с замерами) | от 90 000 ₽ | 1–2 недели |
| Пилот on-premise с RAG | от 480 000 ₽ | 4–6 недель |
| Промышленный контур | 0,9–1,2 млн ₽ | по дорожной карте |
| Сопровождение | от 50 000 ₽/мес | постоянно |
Цены — «от», без НДС (УСН, п. 2 ст. 346.11 НК РФ). Сентябрь 2026. Ставки специалистов — 2 800–3 800 ₽/ч; железо и GPU — отдельной статьёй по вашему выбору поставщика; рыночные ориентиры — в кейсах и ценах.
Смежные услуги и материалы
LLM-интеграции и RAG
ИИ в ваших системах — облако или контур. Пилот от 480 000 ₽.
MLOps-сопровождение
Эксплуатация инференса: мониторинг, релизы, дежурство. Аудит от 90 000 ₽.
Аудит ИИ по 243-ФЗ
Комплаенс для вашего ИИ-контура. Ревизия от 70 000 ₽.
Технологии локального ИИ — раздел технологий; про риски утечек через внешние сервисы — «Утечки через ChatGPT»; про выбор подхода — гайд «Как выбрать LLM для компании».
Честно про железо и ожидания
Локальная LLM — не «бесплатный ChatGPT»: ей нужны ресурсы (GPU-сервер или их пул для промышленных нагрузок), администрирование и сопровождение. На редких сценариях это не окупается — честнее API. На стабильных нагрузках и чувствительных данных — окупается и защищает: стоимость владения сравнивается с облачными счетами, а контроль над данными не имеет облачного эквивалента. Решение принимается по расчёту TCO из аудита (от 90 000 ₽), а не по вере в «своё всегда лучше».
Второй момент — качество: open-source модели сильны в типовых корпоративных задачах, но «самая большая модель в мире на вашем железе» не поместится. Пилот отвечает на вопрос «вытянет ли» честно: замеры на ваших данных до инвестиций в промышленный контур, с порогом «идти/не идти», зафиксированным заранее. Такой дисциплиной мы работаем с 2016 года, включая госсектор: контур под ключ 0,9–1,2 млн ₽, оформление по 44-ФЗ/223-ФЗ, КП за 1 рабочий день.