Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Услуги · Локальная LLM

Локальная LLM в закрытом контуре под ключ — сроки, цены, этапы

Разворачиваем языковые модели на вашей инфраструктуре: ассистенты, RAG и генерация документов работают внутри периметра — ни один запрос не уходит во внешние облака.

Быстрый ответ · актуально на 2026-09-19

Локальная LLM в закрытом контуре — это ваша собственная нейросеть на вашем железе: open-source модель (Qwen, Llama, GPT-OSS и другие) разворачивается на серверах компании или в вашем сегменте дата-центра, а запросы, документы и ответы не покидают периметр. Лестница: разбор — бесплатно; аудит и выбор модели под задачи и железо — от 90 000 ₽ за 1–2 недели; пилот on-premise с RAG по вашим документам — от 480 000 ₽ за 4–6 недель; промышленный контур с резервированием и мониторингом — 0,9–1,2 млн ₽; сопровождение — от 50 000 ₽/мес.

Когда это правильный выбор: персональные данные и коммерческая тайна, требования ИБ и 152-ФЗ, ограничения на облака, большие объёмы запросов, где свой инференс дешевле API. Когда нет: редкие некритичные сценарии — там выгоднее российские API (GigaChat, YandexGPT). Мы честно скажем, какой вариант ваш. Все цены — «от», НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Связаться: +7 (4852) 60-91-96, mail@new-sst.ru.

от 90 000 ₽ — аудит и выбор модели за 1–2 недели; пилот on-premise — от 480 000 ₽ НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Свой ИИ — когда облако не вариант

У облачных нейросетей два неудобных свойства: они чужие и они внешние. Чужие — значит, ваши данные обрабатываются на чужой инфраструктуре по чужим правилам. Внешние — значит, доступ зависит от канала связи, политики поставщика и географии. Для задач с персональными данными, медицинскими записями, кадровой документацией, гостайной или просто коммерческой тайной это не «особенность», а стоп-фактор: служба безопасности не согласует, юрист не благословит, проверяющий не поймёт.

Локальная LLM снимает вопрос архитектурно: модель физически работает на вашей инфраструктуре, запросы и документы циркулируют внутри периметра, доступ регулируется вашими политиками, а журнал — ваш. Современные open-source модели (Qwen, Llama, GPT-OSS и другие) решают типовые корпоративные задачи — ответы по базе знаний, обработка документов, ассистенты — в промышленном качестве, а при больших объёмах запросов собственный инференс оказывается дешевле оплаты токенов. Технологические основы — в наших материалах: «Ollama: локальный LLM», «Open-source LLM для бизнеса», «vLLM serving».

Когда нужна локальная LLM

  • Персональные и чувствительные данные. Медицина, кадры, банки, госсектор: стандарт рынка для таких задач — закрытый контур, где запросы не покидают периметр. Требования 152-ФЗ выполняются «по построению», а не обещаниями вендора.
  • Служба безопасности сказала «облака нельзя». Политики многих компаний запрещают отправку рабочих данных во внешние сервисы. Локальная модель — легальный путь дать сотрудникам ИИ, не ломая эти политики.
  • Комплаенс по 243-ФЗ и 152-ФЗ. Управляемость ИИ: реестр, логи, границы тем, контроль качества — в собственном контуре всё это реализуется полноценно (см. аудит по 243-ФЗ).
  • Большие объёмы запросов. Тысячи обращений в день на API — это счёт за токены, который растёт быстрее пользы. Свой инференс на vLLM при стабильной нагрузке обычно дешевле — это видно на расчёте TCO.
  • Независимость от внешних сервисов. Ограничения доступа, изменения тарифов, отключения API — ваш контур работает, пока работает ваше железо.
  • Специальные требования к моделям. Дообучение под свою предметку, свои правила тона и форматов, полный контроль версий модели — с локальной LLM всё это в ваших руках, без «универсального» поведения чужой модели.

Что делаем

Аудит и выбор модели

Сопоставляем задачи, железо и модели: какие open-source LLM вытянут ваши сценарии, какие нужны ресурсы, что даст квантование. Решение — по замерам на ваших данных, а не по хайпу.

Развёртывание и инфраструктура

Установка и настройка: vLLM для производительности, Kubernetes для оркестрации, квантование для экономии ресурсов. На вашем железе или в вашем сегменте ЦОД.

RAG по вашим документам

База знаний внутри контура: pgvector или Milvus/Qdrant, поиск и ответы со ссылками на документы. Подготовка данных — по гайду.

Интеграции внутри периметра

Подключаем ИИ к вашим системам: 1С, СЭД, интранет, внутренние сервисы (см. LLM-интеграции). Обмен данными — только внутри контура.

Безопасность и защита ИИ

Права доступа, ограничение тем, защита от промпт-инъекций и jailbreak (guardrails), логирование. ИИ-контур закрывается как любой ИТ-сервис с особым режимом.

Мониторинг и сопровождение

Контроль качества ответов, нагрузки и стоимости инференса, обновления моделей и зависимостей. Сопровождение — от 50 000 ₽/мес (см. MLOps).

Как проходит работа: этапы

  1. Разбор — бесплатно, 1 рабочий день. Присылаете описание задач и ограничений (какие данные, какие политики, какое железо есть). Возвращаемся с планом и вилкой цен.
  2. Аудит и выбор модели — от 90 000 ₽, 1–2 недели. Карта сценариев и данных, замеры моделей-кандидатов на ваших примерах, требования к железу, TCO против облачных API. Отчёт: какая модель, почему, сколько стоит владение.
  3. Пилот on-premise — от 480 000 ₽, 4–6 недель. Контур на вашем железе: модель + RAG по первому массиву документов, доступ для пилотной группы, замеры качества и скорости.
  4. Замеры и решение. Качество ответов и производительность против метрик, зафиксированных до старта. Если модель не дотягивает — меняем конфигурацию (модель/квантование/железо), а не «убеждаем себя».
  5. Промышленный контур — 0,9–1,2 млн ₽. Все пользователи и сценарии, резервирование, мониторинг, интеграции, документация, обучение команды и передача в эксплуатацию.
  6. Сопровождение — от 50 000 ₽/мес. Обновления моделей, контроль качества, развитие базы знаний и сценариев.

Технологии и подход

Модельный ряд — open-source LLM из числа актуальных (линейки Qwen, Llama, GPT-OSS и другие — обзор в «Open-source LLM для бизнеса»); для быстрого старта на умеренных нагрузках — Ollama, для промышленного инференса — vLLM; ускорение и удешевление — квантование GGUF/AWQ; память — pgvector. Если часть сценариев не чувствительна — строим гибрид: некритичное на российских API, чувствительное в контуре. Для связанных с персональными данными систем спланируем аттестацию с лицензированным соисполнителем (ИСПДн и 152-ФЗ).

Цены и сроки

СтупеньЦенаСрок
Разбор задач и ограниченийбесплатно1 рабочий день
Аудит и выбор модели (с замерами)от 90 000 ₽1–2 недели
Пилот on-premise с RAGот 480 000 ₽4–6 недель
Промышленный контур0,9–1,2 млн ₽по дорожной карте
Сопровождениеот 50 000 ₽/меспостоянно

Цены — «от», без НДС (УСН, п. 2 ст. 346.11 НК РФ). Сентябрь 2026. Ставки специалистов — 2 800–3 800 ₽/ч; железо и GPU — отдельной статьёй по вашему выбору поставщика; рыночные ориентиры — в кейсах и ценах.

Смежные услуги и материалы

LLM-интеграции и RAG

ИИ в ваших системах — облако или контур. Пилот от 480 000 ₽.

MLOps-сопровождение

Эксплуатация инференса: мониторинг, релизы, дежурство. Аудит от 90 000 ₽.

Аудит ИИ по 243-ФЗ

Комплаенс для вашего ИИ-контура. Ревизия от 70 000 ₽.

Технологии локального ИИ — раздел технологий; про риски утечек через внешние сервисы — «Утечки через ChatGPT»; про выбор подхода — гайд «Как выбрать LLM для компании».

Честно про железо и ожидания

Локальная LLM — не «бесплатный ChatGPT»: ей нужны ресурсы (GPU-сервер или их пул для промышленных нагрузок), администрирование и сопровождение. На редких сценариях это не окупается — честнее API. На стабильных нагрузках и чувствительных данных — окупается и защищает: стоимость владения сравнивается с облачными счетами, а контроль над данными не имеет облачного эквивалента. Решение принимается по расчёту TCO из аудита (от 90 000 ₽), а не по вере в «своё всегда лучше».

Второй момент — качество: open-source модели сильны в типовых корпоративных задачах, но «самая большая модель в мире на вашем железе» не поместится. Пилот отвечает на вопрос «вытянет ли» честно: замеры на ваших данных до инвестиций в промышленный контур, с порогом «идти/не идти», зафиксированным заранее. Такой дисциплиной мы работаем с 2016 года, включая госсектор: контур под ключ 0,9–1,2 млн ₽, оформление по 44-ФЗ/223-ФЗ, КП за 1 рабочий день.

Коротко о главном

ПараметрЗначение
Составвыбор модели с замерами, развёртывание (vLLM/Kubernetes), RAG в контуре, безопасность, мониторинг
Цена от90 000 ₽ (аудит и выбор модели, 1–2 недели); пилот on-premise — от 480 000 ₽
Моделиopen-source LLM: Qwen, Llama, GPT-OSS и другие — по замерам на ваших данных
НалогиНДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ)
Гарантия приватностизапросы и документы не покидают ваш периметр; логи и доступы — ваши
Первый шагописание задач и железа на mail@new-sst.ru — разбор бесплатно

Смотрите также

Частые вопросы: локальная LLM в контуре

Зависит от задачи. На ответах по базе знаний, обработке документов, классификации и ассистентах открытые модели решают корпоративные задачи в промышленном качестве — это подтверждается замерами на пилоте. На «творческих» задачах экстра-класса самые большие облачные модели могут быть сильнее. Наш подход: не верить на слово ни одной стороне — пилот с метриками «идти/не идти» до больших инвестиций.

Для пилота часто достаточно имеющегося сервера или одной GPU-карты с квантованием модели — оцениваем в аудите (от 90 000 ₽). Промышленная нагрузка требует нормального железа, но оно остаётся вашим активом и окупается на больших объёмах против оплаты токенов. Расчёт TCO «железо против API» — часть аудита, решение за вами.

Архитектурно — да: модель, база знаний и инференс работают внутри вашего периметра, внешних вызовов нет, доступы и логи — ваши. Мы дополнительно закрываем контур политиками: ограничение тем, guardrails, контроль исходящего трафика. Для систем с персональными данными спланируем аттестацию (ИСПДн) с лицензированным соисполнителем.

Аудит и выбор модели с замерами — 1–2 недели (от 90 000 ₽). Пилот on-premise с RAG по вашим документам — 4–6 недель (от 480 000 ₽). Промышленный контур с резервированием и мониторингом — 0,9–1,2 млн ₽ по дорожной карте. Разбор и план — бесплатно за 1 рабочий день.

Варианты: ваша команда (контур сдаём с документацией и обучением), наше сопровождение (от 50 000 ₽/мес: обновления моделей, контроль качества, развитие сценариев — см. MLOps) или гибрид. Вендор-лока нет: всё на открытых инструментах, ваших репозиториях и вашем железе — вы не привязаны к нам сильнее, чем захотите сами.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: mail@new-sst.ru

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты приведены по состоянию на 2026-09-19. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).

Наша экспертиза

ООО «НЬЮ-ССТ» (ИНН 7733311994) работает с 2016 года. Действующие системы: vyshka.cloud (33 сервиса), мессенджер, академия. Более 250 коммерческих предложений за сентябрь 2026.

Подготовлено специалистами ООО «НЬЮ-ССТ»

Обновлено: сентябрь 2026