Чтобы запустить модель локально, её нужно уместить в память ускорителей, и именно здесь квантизация становится главным инструментом: весовые коэффициенты нейросети хранятся числами с плавающей точкой (обычно 16 бит), а квантизация переводит их в 8- или 4-битные целые. Память падает в разы, скорость инференса растёт, качество на типовых задачах проседает незначительно. Для локальных контуров это часто решающий фактор реализуемости проекта в принципе.
Как работает
Число меньшей разрядности хранит значение с грубым шагом, поэтому при переводе весов часть точности теряется — но обучение модели распределяет веса так, что «округление» большинства из них почти не меняет итоговое поведение. На практике выбор идёт между форматами: 8-битная квантизация почти неотличима от оригинала, 4-битная экономит максимум памяти и требует проверки на контрольных задачах. Промежуточные варианты подбираются под конкретный бюджет железа.
Зачем бизнесу
- Локальный контур на меньшем железе: та же модель работает на меньшем числе GPU — прямая экономия TCO.
- Пропускная способность: больше одновременных запросов на тех же ускорителях.
- Задержки: ответы быстрее — важно для голосовых агентов и поддержки.
- Суверенные модели: локальный запуск открытых архитектур на доступных в РФ ускорителях без внешних API.
Экономику решает не только железо: квантизованная модель дешевле в эксплуатации круглосуточно — меньше энергии на запрос, меньше охлаждение, дольше жизнь парка при росте нагрузки. При постоянных высоких потоках обработки документов эти проценты складываются в ощутимую статью экономии уже за первый год.
Когда оправдана и когда нет
Для классификации документов, извлечения реквизитов и диалоговой поддержки квантизованная модель практически не уступает исходной. Для сложных многошаговых рассуждений и юридически значимых разборов деградацию нужно мерить: до выкатки прогоняется контрольный набор задач и сравнивается качество «до/после». Решение принимается по цифрам, а не по ощущениям.
Есть и технические нюансы: не каждый инструмент инференса поддерживает все форматы квантизации, смешивание разрядности внутри одной сборки порой даёт выигрыш (например, чувствительные слои остаются в 16 битах, остальные сжимаются), а для маленьких моделей агрессивное сжатие заметнее бьёт по качеству, чем для больших. Эти компромиссы и есть предмет пилота: на вашем железе, ваших задачах и ваших данных ответ получается точнее любых общих таблиц.
Порядок величин
Ориентир для планирования: модель класса «десятки миллиардов параметров» в 16-битном формате занимает десятки гигабайт на каждый экземпляр, в 4-битном — вчетверо меньше. Для владельца контура это прямая арифметика: либо больше ускорителей под исходную точность, либо те же задачи на меньшем парке с квантизацией. Второй порядок величин — память под контекст: чем длиннее окно, тем больше оперативной памяти резервируется под каждый запрос, и это тоже учитывается в железе. Складывая оба фактора, итоговую конфигурацию считают не «по прайсу видеокарты», а от реального профиля нагрузки: частота запросов, длина документов, требуемое время ответа.
Цены «от» (сентябрь 2026)
Пилот LLM с подбором и квантизацией модели — от 480 000 ₽ за 4–6 недель; полный промышленный контур — 0,9–1,2 млн ₽; сопровождение — от 50 000 ₽/мес; часовые ставки специалистов — 2 800–3 800 ₽/ч. Цены сентября 2026, без НДС (УСН).
С чего начать
Определите задачи и контрольный набор для замера качества, затем пилот: подбор архитектуры, квантизация, замеры на вашем железе. Так появляется экономика решения — до закупки серверов, а не после, когда менять конфигурацию уже дорого.