On-premise — это когда модель с открытыми весами работает на ваших или арендованных серверах под вашим контролем: промпты и база знаний не покидают периметр. Так приходят туда, где данные нельзя отдать вовне: персональные данные в чувствительных процессах, коммерческая тайна, закрытые контуры госзаказчиков, требования к государственным информационным системам. Выбор модели здесь решает половину успеха — вторую половину решает инфраструктура.
Гайд — про критерии выбора open-weights модели, а не сравнение конкретных моделей: разборы актуальных моделей живут в разделе сравнений. План из семи шагов закрывает главный риск таких проектов — покупку «самой мощной» модели, которая не влезает в сервер, лицензионно запрещена в коммерческом продукте или плохо говорит по-русски. Развёртывание контура под ключ у НЬЮ-ССТ — 0,9–1,2 млн ₽ (сентябрь 2026).
Пошаговый план
Зафиксируйте задачи и причину on-premise
Сформулируйте, зачем именно локальный контур: юридическое требование, политика безопасности, недоступность внешних API из закрытой сети, стоимость на большой нагрузке. Выпишите задачи (поиск по базе знаний, суммаризация документов, генерация ответов, классификация) с требованиями к качеству и скорости ответа. Причина определяет бюджет и допустимые компромиссы: требование локализации не лечится «ну почти on-premise» через внешний API.
Отсейте модели по лицензии
Открытые веса — не всегда свободное использование. Проверьте лицензию каждой модели-кандидата: допускает ли она коммерческое применение, есть ли ограничения по числу пользователей, требование раскрывать свои изменения, запрет использовать веса для обучения других моделей, пороги выручки. Внутренний корпоративный ассистент и модель внутри продаваемого продукта — разные лицензионные сценарии. Вердикт юриста фиксируется письменно до покупки железа.
Посчитайте железо под размер модели
Размер модели в миллиардах параметров определяет память GPU: для инференса в половинной точности ориентир — примерно два гигабайта на миллиард параметров с учётом накладных расходов, при квантизации меньше. Соберите варианты: 7–8B — одна серверная GPU-карта, 30–35B — несколько карт или уменьшенная точность, 70B и выше — серьёзный сервер или несколько. Прибавьте память под контекст длинных промптов с базой знаний — на больших контекстах она становится главным потребителем. Плюс резерв под параллельные запросы.
Выберите степень квантизации
Квантизация — сжатие модели с меньшей точностью чисел: меньше памяти, быстрее и дешевле, но качество проседает тем заметнее, чем сильнее сжатие и чем сложнее задача. Рабочие диапазоны для корпоративных сценариев — от 8-бит до 4-бит; ниже — только для простых задач. Правило: квантизацию выбирает не статья в интернете, а ваш бенчмарк — одна и та же степень сжатия по-разному влияет на разные модели и разные задачи.
Прогоните бенчмарк на своих задачах
Соберите свой набор: 100–200 реальных вопросов и документов вашей компании, эталонные ответы или критерии. Гоняйте кандидатов на одном стенде, меряйте правильность, опору на документы, качество русского языка, скорость ответа при вашей нагрузке. Публичные лидерборды — только для первичного отсева: они меряют общие способности, а не вашу базу знаний и ваших пользователей. Смотрите и на отказы: модель, которая честно не отвечает на непокрытое, безопаснее выдумывающей.
Оцените полную стоимость владения
Считайте не только карты: аренда или амортизация серверов, электроэнергия и размещение, инженерная поддержка инференса (обслуживание, мониторинг, сбои), резервный контур на случай деградации, периодические обновления модели. Сравните с ценой облачного контура на горизонте 1–2 лет при вашем профиле нагрузки. Иногда честный ответ — гибрид: чувствительные сценарии на своей модели, массовые простые — в облаке в РФ.
Проверьте безопасность и путь сопровождения
Локальная модель без фильтров отвечает на вредоносные запросы свободнее, чем облачная с защитами: план защиты — фильтры промпт-инъекций, ограничение тем, права доступа к базам знаний — нужен с первого дня. Уточните сопровождение: как выходят обновления весов, кто чинит баги инференса, что будет через год, когда модель устареет. Модель без живого сообщества или вендора — риск остаться на неподдерживаемой версии с известными уязвимостями.
Чек-лист
Модель готова к покупке контура, если:
- Причина on-premise сформулирована и подтверждает выбор
- Задачи описаны с требованиями к качеству и скорости
- Лицензия проверена юристом на коммерческое использование
- Ограничения лицензии по пользователям и продукту учтены
- Размер модели сопоставлен с памятью GPU с запасом
- Память под длинный контекст посчитана в бюджете
- Параллельная нагрузка проверена на стенде
- Степень квантизации выбрана по своему бенчмарку
- Свой набор из 100–200 задач собран с эталонами
- Качество русского языка проверено на своих данных
- Отказы на непокрытых темах честные, без выдумок
- TCO посчитан на 1–2 года с поддержкой и обновлениями
- Сравнение с облачным контуром в РФ сделано честно
- План защиты от инъекций и вредоносных запросов готов
- Путь обновлений модели и поддержка определены
Что влияет на результат
Итог выбора определяется ограничениями, а не желаниями. Жёсткие требования к данным снимают варианты с внешними API сразу — дальше решают бюджет железа и профиль задач. Для поиска по базе знаний часто достаточно средних моделей с щепетильной настройкой retrieval; генерация длинных документов и сложные цепочки рассуждений поднимают требования и к размеру, и к памяти под контекст. Русский язык остаётся фильтром: модели одного размера заметно различаются на русскоязычных задачах, и это выясняется только на своём наборе. Влияет и доступность инженерной поддержки: контур, за которым некому следить, деградирует независимо от качества выбранной модели. Опыт эксплуатации в РФ с локацией серверов и обслуживанием закрывает эту часть рисков — выбор модели и контура лучше делать одним решением.
Реалистичный срок выбора — три–четыре недели без учёта закупки железа: неделя на лицензии и список кандидатов, неделя на стенд, полторы на бенчмарки и решение. Не начинайте закупку серверов до бенчмарка: замеры на арендованных картах дешевле ошибки на целый сервер. Аренда GPU на этап выбора — нормальная практика, собственное железо покупают под уже выбранную модель. Держите в списке кандидатов две–три модели, а не одну: запасной вариант спасает при изменении лицензии или снятии модели с поддержки. Для русскоязычных задач собирайте в наборе именно ваши формулировки — генеральные тексты на русском встречаются в открытым весах с разным качеством. И зафиксируйте критерий приемлемости до прогона: решение «норм» после просмотра результатов подтаскивает выводы под желаемое.
Частые ошибки
Проекты on-premise чаще всего буксуют из-за следующих ошибок:
- Выбор по лидерборду. первые строчки публичных рейтингов не гарантируют качество на вашей базе знаний и вашем русском языке — только свой бенчмарк
- Железо после модели. купленная «самая умная» модель, не влезающая в сервер по памяти, — классика; сначала бюджет железа, потом кандидаты
- Лицензия почитана потом. отдельные лицензии запрещают коммерческое применение или ставят пороги по пользователям — проверка до закупки
- Максимальное сжатие. агрессивная квантизация убивает именно тонкие задачи — суммаризацию и работу с документами; меряйте на своих данных
- Инференс без инженера. развернуть модель — начало; без мониторинга, обновлений и плана сбоев контур деградирует за квартал
Инструменты и сроки
Нужны матрица задач, тестовый GPU-стенд и протокол бенчмарка; по срокам считайте 3–4 недели от списка кандидатов до решения по своему набору. Экономия на стене ложная: тест на чужих цифрах приводит к покупке не той модели и потере месяца уже на боевом контуре.
- Матрица задач и классов данных
- Тестовый стенд GPU
- Протокол бенчмарка на своих данных
Что получится в итоге
На выходе — обоснованное решение: модель проходит по лицензии, влезает в железо с запасом, держит ваш русский язык и ваши задачи, а стоимость владения посчитана на годы вперёд. Контур под вашим контролем принимает чувствительные данные, не нарушая ни политики, ни требований локализации. И когда через год выйдут новые модели, замена станет рутинной операцией по той же методике: свой бенчмарк, те же критерии, решение за неделю, а не за квартал.