Квантование — сжатие модели с понижением точности весов (int8, int4, GGUF-форматы) — главный рычаг экономики локального LLM: модель в 2–4 раза меньше влезает в память, работает на дешёвых GPU и даже на CPU. Плата — потенциальная потеря качества: обычно умеренная, но не гарантированная и не равномерная по задачам. Поэтому выбор «квантованная или полная» — не вопрос веры, а вопрос измерения на своих данных.
Ниже — таблицы «когда что» и критериев. Смежные материалы: «Ollama против vLLM» и «Qwen или Llama для on-premise»; технический базис — статья словаря «квантование LLM» и обзор «GGUF/AWQ».
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Что выбрать | Почему |
|---|---|---|
| Ограниченный бюджет железа, модель «не влезает» | квантованная | int8/int4 сокращает память в 2–4 раза |
| Типовые задачи: классификация, извлечение, суммаризация | квантованная | потери на типовых задачах обычно незаметны |
| Сложные рассуждения, длинные цепочки, юр/мед тексты | полная или слабое квантование | деградация проявляется на сложных задачах сильнее |
| Прототип на рабочей станции | квантованная | GGUF-сборки запускаются без GPU-сервера |
| Высокая нагрузка и пропускная способность | квантованная | меньше память — больше параллелизм и скорость |
| Задача уже на грани качества на полной модели | полная | запас прочности важнее экономии железа |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | Квантованная модель | Полная модель (fp16) |
|---|---|---|
| Потребность в памяти | в 2–4 раза ниже, вплоть до CPU | полный объём под каждую копию |
| Железо и стоимость | дешёвые GPU или рабочие станции | GPU-сервер, контур от 690 000 ₽ |
| Качество | обычно близко; проверяется на своих данных | максимум для данной модели |
| Пропускная способность | выше: меньше память — больше параллелизм | ниже на том же железе |
| Риски | тихая деградация на сложных задачах | риски самой модели, без добавки от сжатия |
| Проверка | eval обязателен до продакшена | eval обязателен, но без фактора сжатия |
| Сопровождение | пересборка и проверка при смене версии | обновление весов по регламенту |
Строки «качество» и «пропускная способность» двигаются вместе: сжатие чаще выигрывает дважды — и в железе, и в скорости. Единственная опасность — тихая деградация, поэтому строка «проверка» обязательна для обеих колонок, а не только для квантованной.
Разбор критериев
Экономика: что покупает сжатие
Память — главный дефицит инференса: полная модель требует её весь объём на каждую копию, квантованная — вдвое-вчетверо меньше. На практике это означает: та же GPU даёт больше параллельных потоков, типовое железо офисного класса запускает модель целиком, а прототипы живут на рабочих станциях. Промышленный контур с квантованными моделями — от 690 000 ₽; локальный контур полного размера — 0,9–1,2 млн ₽ — и почему локальный контур в итоге выгоднее облака на дистанции, разбирает ответ на вопрос «почему on-premise дороже облака, но выгоднее»; полная стоимость — гайд «TCO ИИ-решения».
Качество: чего ждать от int8 и int4
Потери от квантования обычно умеренны, но распределены неравномерно: типовые задачи — классификация, извлечение полей, суммаризация — чаще всего держатся, а сложные рассуждения, редкие языки и точные формулировки деградируют первыми. Никакие публичные таблицы не заменят ваш прогон: собирается выборка реальных задач, сравниваются полная и квантованная версии вслепую, решение фиксируется по метрикам. Методика — в гайде «как оценить качество ответов LLM»; про честные измерения — «eval и бенчмарки».
Железо и выбор формата
Форматы сжатия подбираются под рантайм: GGUF — стандарт локальных запусков (Ollama, llama.cpp), серверные форматы — сборки под GPU. Уровень сжатия — от int8 (консервативно) до 4-битных вариантов (агрессивно): чем сильнее сжатие, тем обязательнее eval. Как рантаймы соотносятся между собой — в сравнении «Ollama или vLLM»; выбор конкретной модели под железо — «Qwen или Llama для on-premise».
Пропускная способность
На высокой нагрузке квантование — не компромисс, а выигрыш: меньше памяти на копию — больше одновременных потоков на том же железе, ниже латентность очереди. Для массовых фоновых обработок (см. «батч или реалтайм») квантованная модель часто оказывается единственным вариантом, укладывающимся в бюджет железа.
Риски и границы применения
Главный риск квантования — тихий: система продолжает отвечать, но чуть хуже на сложных случаях, и замечают это пользователи, а не мониторинг. Против этого — фиксация тестовой выборки и регламент перепроверки при каждой смене версии модели или формата сжатия. Для юридических, медицинских и финансовых текстов, где цена формулировки высока, по умолчанию оставляют полную модель или самое слабое квантование — и это решение тоже фиксируют в реестре ИИ-активов (243-ФЗ).
Смежные технологии сжатия
Квантование — не единственный путь уменьшить модель: дистилляция обучает компактную модель «под учителя» — дольше, но с потенциально лучшим качеством; выбор меньшей модели из линейки того же семейства часто проще и надёжнее сжатия большой. Комбинация подходов — маленькая модель плюс int8 — рабочая схема для граничных бюджетов; о вариантах — статья «дистилляция моделей» и сравнение «SLM против LLM».
Вердикты по трём сценариям
Сценарий 1. Ограниченное железо, типовые задачи
Квантованная модель (int8 или GGUF-сборка): контур от 690 000 ₽, качество подтверждается eval-ом на своих задачах. Для большинства бизнес-сценариев — извлечение, классификация, поддержка — это оптимум.
Сценарий 2. Сложные задачи с высокой ценой формулировки
Полная модель или слабое квантование: локальный контур 0,9–1,2 млн ₽, тестовая выборка сложных случаев обязательна. Экономия железа не окупает тихую деградацию в юридическом или медицинском тексте.
Сценарий 3. Прототип и пилот
Квантованные сборки через Ollama: старт без закупки GPU, прототип от 90 000 ₽. При масштабировании решение о формате пересматривается с eval-ом — но уже с реальными данными и пониманием задачи.
Типичные ошибки выбора
Пять ошибок при сжатии моделей в локальном контуре.
- Квантование по умолчанию без eval-а: тихая деградация замечена пользователями.
- Агрессивное 4-битное сжатие на юридических текстах ради экономии железа.
- Формат сжатия не согласован с рантаймом: пересборка в авральном порядке.
- Тестовая выборка без сложных случаев: деградация прячется именно в них.
- Смена версии модели без перепроверки формата: прошлогодний eval больше не действует.
Итог
Квантование — рычаг экономики, а не вера: int8 для типовых задач, полная модель там, где цена формулировки высока, и обязательный eval перед каждым продакшеном. Так сжатие покупает дешёвое железо, не покупая тихие ошибки. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Зафиксируйте бюджет железа: он определяет допустимую степень сжатия.
- Соберите тестовую выборку из реальных задач со сложными случаями.
- Сравните полную и квантованную версии вслепую до решения.
- Выберите формат под рантайм: GGUF для локальных, серверные варианты для GPU.
- Определите красные линии: где допустима экономия, где только полная модель.
- Заложите регламент перепроверки при смене версии или формата сжатия.
- Отразите выбранный формат и результаты eval в реестре ИИ-активов (243-ФЗ).
Смежные материалы
Смежные сравнения: «Ollama или vLLM», «Qwen или Llama для on-premise» и «SLM против LLM». Технологии: «квантование GGUF/AWQ» и «Ollama для локального LLM». Словарь: «квантование LLM». Гайд: «как оценить качество ответов LLM».
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.