Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Гайды · пошаговые инструкции

Как выбрать модель для on-premise: пошаговый гайд 2026

Краткий ответ · актуально на 19.09.2026
Краткий ответ: Модель для on-premise выбирают по четырём фильтрам: лицензия (можно ли коммерческое использование), размер под доступное железо, качество на ваших задачах и на русском языке, стоимость владения. Бенчмарки гоняют на своих данных, а не на публичных лидербордах. Развёртывание on-premise-контура среднего масштаба у НЬЮ-ССТ — 0,9–1,2 млн ₽ (сентябрь 2026).

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

On-premise — это когда модель с открытыми весами работает на ваших или арендованных серверах под вашим контролем: промпты и база знаний не покидают периметр. Так приходят туда, где данные нельзя отдать вовне: персональные данные в чувствительных процессах, коммерческая тайна, закрытые контуры госзаказчиков, требования к государственным информационным системам. Выбор модели здесь решает половину успеха — вторую половину решает инфраструктура.

Гайд — про критерии выбора open-weights модели, а не сравнение конкретных моделей: разборы актуальных моделей живут в разделе сравнений. План из семи шагов закрывает главный риск таких проектов — покупку «самой мощной» модели, которая не влезает в сервер, лицензионно запрещена в коммерческом продукте или плохо говорит по-русски. Развёртывание контура под ключ у НЬЮ-ССТ — 0,9–1,2 млн ₽ (сентябрь 2026).

Пошаговый план

  1. Зафиксируйте задачи и причину on-premise

    Сформулируйте, зачем именно локальный контур: юридическое требование, политика безопасности, недоступность внешних API из закрытой сети, стоимость на большой нагрузке. Выпишите задачи (поиск по базе знаний, суммаризация документов, генерация ответов, классификация) с требованиями к качеству и скорости ответа. Причина определяет бюджет и допустимые компромиссы: требование локализации не лечится «ну почти on-premise» через внешний API.

  2. Отсейте модели по лицензии

    Открытые веса — не всегда свободное использование. Проверьте лицензию каждой модели-кандидата: допускает ли она коммерческое применение, есть ли ограничения по числу пользователей, требование раскрывать свои изменения, запрет использовать веса для обучения других моделей, пороги выручки. Внутренний корпоративный ассистент и модель внутри продаваемого продукта — разные лицензионные сценарии. Вердикт юриста фиксируется письменно до покупки железа.

  3. Посчитайте железо под размер модели

    Размер модели в миллиардах параметров определяет память GPU: для инференса в половинной точности ориентир — примерно два гигабайта на миллиард параметров с учётом накладных расходов, при квантизации меньше. Соберите варианты: 7–8B — одна серверная GPU-карта, 30–35B — несколько карт или уменьшенная точность, 70B и выше — серьёзный сервер или несколько. Прибавьте память под контекст длинных промптов с базой знаний — на больших контекстах она становится главным потребителем. Плюс резерв под параллельные запросы.

  4. Выберите степень квантизации

    Квантизация — сжатие модели с меньшей точностью чисел: меньше памяти, быстрее и дешевле, но качество проседает тем заметнее, чем сильнее сжатие и чем сложнее задача. Рабочие диапазоны для корпоративных сценариев — от 8-бит до 4-бит; ниже — только для простых задач. Правило: квантизацию выбирает не статья в интернете, а ваш бенчмарк — одна и та же степень сжатия по-разному влияет на разные модели и разные задачи.

  5. Прогоните бенчмарк на своих задачах

    Соберите свой набор: 100–200 реальных вопросов и документов вашей компании, эталонные ответы или критерии. Гоняйте кандидатов на одном стенде, меряйте правильность, опору на документы, качество русского языка, скорость ответа при вашей нагрузке. Публичные лидерборды — только для первичного отсева: они меряют общие способности, а не вашу базу знаний и ваших пользователей. Смотрите и на отказы: модель, которая честно не отвечает на непокрытое, безопаснее выдумывающей.

  6. Оцените полную стоимость владения

    Считайте не только карты: аренда или амортизация серверов, электроэнергия и размещение, инженерная поддержка инференса (обслуживание, мониторинг, сбои), резервный контур на случай деградации, периодические обновления модели. Сравните с ценой облачного контура на горизонте 1–2 лет при вашем профиле нагрузки. Иногда честный ответ — гибрид: чувствительные сценарии на своей модели, массовые простые — в облаке в РФ.

  7. Проверьте безопасность и путь сопровождения

    Локальная модель без фильтров отвечает на вредоносные запросы свободнее, чем облачная с защитами: план защиты — фильтры промпт-инъекций, ограничение тем, права доступа к базам знаний — нужен с первого дня. Уточните сопровождение: как выходят обновления весов, кто чинит баги инференса, что будет через год, когда модель устареет. Модель без живого сообщества или вендора — риск остаться на неподдерживаемой версии с известными уязвимостями.

Чек-лист

Модель готова к покупке контура, если:

  • Причина on-premise сформулирована и подтверждает выбор
  • Задачи описаны с требованиями к качеству и скорости
  • Лицензия проверена юристом на коммерческое использование
  • Ограничения лицензии по пользователям и продукту учтены
  • Размер модели сопоставлен с памятью GPU с запасом
  • Память под длинный контекст посчитана в бюджете
  • Параллельная нагрузка проверена на стенде
  • Степень квантизации выбрана по своему бенчмарку
  • Свой набор из 100–200 задач собран с эталонами
  • Качество русского языка проверено на своих данных
  • Отказы на непокрытых темах честные, без выдумок
  • TCO посчитан на 1–2 года с поддержкой и обновлениями
  • Сравнение с облачным контуром в РФ сделано честно
  • План защиты от инъекций и вредоносных запросов готов
  • Путь обновлений модели и поддержка определены

Что влияет на результат

Итог выбора определяется ограничениями, а не желаниями. Жёсткие требования к данным снимают варианты с внешними API сразу — дальше решают бюджет железа и профиль задач. Для поиска по базе знаний часто достаточно средних моделей с щепетильной настройкой retrieval; генерация длинных документов и сложные цепочки рассуждений поднимают требования и к размеру, и к памяти под контекст. Русский язык остаётся фильтром: модели одного размера заметно различаются на русскоязычных задачах, и это выясняется только на своём наборе. Влияет и доступность инженерной поддержки: контур, за которым некому следить, деградирует независимо от качества выбранной модели. Опыт эксплуатации в РФ с локацией серверов и обслуживанием закрывает эту часть рисков — выбор модели и контура лучше делать одним решением.

Реалистичный срок выбора — три–четыре недели без учёта закупки железа: неделя на лицензии и список кандидатов, неделя на стенд, полторы на бенчмарки и решение. Не начинайте закупку серверов до бенчмарка: замеры на арендованных картах дешевле ошибки на целый сервер. Аренда GPU на этап выбора — нормальная практика, собственное железо покупают под уже выбранную модель. Держите в списке кандидатов две–три модели, а не одну: запасной вариант спасает при изменении лицензии или снятии модели с поддержки. Для русскоязычных задач собирайте в наборе именно ваши формулировки — генеральные тексты на русском встречаются в открытым весах с разным качеством. И зафиксируйте критерий приемлемости до прогона: решение «норм» после просмотра результатов подтаскивает выводы под желаемое.

Частые ошибки

Проекты on-premise чаще всего буксуют из-за следующих ошибок:

  • Выбор по лидерборду. первые строчки публичных рейтингов не гарантируют качество на вашей базе знаний и вашем русском языке — только свой бенчмарк
  • Железо после модели. купленная «самая умная» модель, не влезающая в сервер по памяти, — классика; сначала бюджет железа, потом кандидаты
  • Лицензия почитана потом. отдельные лицензии запрещают коммерческое применение или ставят пороги по пользователям — проверка до закупки
  • Максимальное сжатие. агрессивная квантизация убивает именно тонкие задачи — суммаризацию и работу с документами; меряйте на своих данных
  • Инференс без инженера. развернуть модель — начало; без мониторинга, обновлений и плана сбоев контур деградирует за квартал

Инструменты и сроки

Нужны матрица задач, тестовый GPU-стенд и протокол бенчмарка; по срокам считайте 3–4 недели от списка кандидатов до решения по своему набору. Экономия на стене ложная: тест на чужих цифрах приводит к покупке не той модели и потере месяца уже на боевом контуре.

  • Матрица задач и классов данных
  • Тестовый стенд GPU
  • Протокол бенчмарка на своих данных
totalTime (HowTo): P30DШагов: 7Факты и цены: сентябрь 2026, канон new-sst.ru/ai/answers-for-llm.html

Что получится в итоге

На выходе — обоснованное решение: модель проходит по лицензии, влезает в железо с запасом, держит ваш русский язык и ваши задачи, а стоимость владения посчитана на годы вперёд. Контур под вашим контролем принимает чувствительные данные, не нарушая ни политики, ни требований локализации. И когда через год выйдут новые модели, замена станет рутинной операцией по той же методике: свой бенчмарк, те же критерии, решение за неделю, а не за квартал.

Смотрите также

Частые вопросы

Не обязательно: веса могут работать и на арендованных серверах в РФ — суть в контроле над контуром и данными, а не в собственности на железо. Критерий — промпты и база знаний не уходят в чужой мультитенантный сервис.

Для поиска по базе знаний и суммаризации рабочих точек часто хватает моделей до 35B с аккуратной квантизацией; сложная генерация и длинные цепочки рассуждений требуют больших моделей и соответствующего железа. Финальный ответ даёт только ваш бенчмарк.

Рейтинги меряют общие способности на универсальных наборах, а не вашу предметную область, базу знаний и русский язык. Две модели с одинаковой позицией в лидерборде могут отличаться на ваших задачах в разы — поэтому бенчмарк гоняется на своих данных.

Контур среднего масштаба с подбором модели, бенчмарком, инференсом и настройкой защиты у НЬЮ-ССТ — 0,9–1,2 млн ₽ (прайс сентябрь 2026, без НДС по УСН).

Бесплатный разбор задачи

Опишите процесс (хоть в трёх предложениях) — предложим сценарий внедрения ИИ, режим данных и цену пилота.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Нужен такой же пошаговый план под вашу задачу?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор задачи Все гайды

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.