Что такое квантование и чем GGUF отличается от AWQ
Квантование — снижение точности представления весов модели: вместо 16 бит на вес — 4 или 8. Практический эффект: модель занимает в 2–4 раза меньше памяти, быстрее считается и влезает на доступное железо. Платой может быть просадка качества — поэтому любое сжатие мы сопровождаем замером на задаче заказчика.
GGUF — формат экосистемы llama.cpp: один файл с весами, метаданными и токенизатором; в нём распространяются квантованные версии моделей (Q4_K_M, Q5_K_M, Q8 и другие уровни). GGUV выбирают для CPU-инференса и Ollama. AWQ (activation-aware weight quantization) — метод 4-битного сжатия, «знающий» о распределении активаций; его версии моделей предназначены для GPU-инференса на vLLM. Есть и GPTQ — старший родственник AWQ для тех же сценариев.
Когда какой формат выбираем
- GGUF: нет GPU или карта скромная; офисный сервер, рабочая станция, ВМ в существующем контуре; модель до 8–14 млрд параметров спокойно живёт на CPU.
- GGUF: пилоты и демо, где важно быстро показать заказчику работающее решение без закупки ускорителей.
- AWQ: промышленный GPU-инференс на vLLM: 4-битная модель обслуживает заметно больше параллельных запросов на той же карте, чем 16-битная.
- AWQ: длинный контекст и пиковые нагрузки, где каждый гигабайт видеопамяти на счету.
- Без квантования (FP16/BF16): задачи повышенной точности (юридические, медицинские формулировки) и запас железа — сжатие не самоцель.
Как применяем: этапы и схема
- Подбор модели и уровня сжатия. Из требований (задача, языки, латентность) выбираем 2–3 кандидата: например, 7B в Q4_K_M против 14B в Q4, либо AWQ-версию для vLLM.
- Стенд. Разворачиваем целевое железо заказчика (или эквивалент), поднимаем инференс: Ollama для GGUF, vLLM для AWQ.
- Контрольные задачи. Готовим набор реальных заданий: вопросы по документам, извлечение полей, суммаризация — 100–300 примеров с эталонами.
- Замер пары «качество/скорость». Прогоняем квантованные и оригинальные веса; сравниваем точность, латентность, пропускную способность, потребление памяти. Решение — по цифрам, а не по ощущениям.
- Фиксация. Выбранные веса (файл GGUF или образ с AWQ) версионируем: хеш, источник, лицензия базовой модели, дата. Это защита от тихой подмены «таких же» весов.
- Бой и пере-замер. Контур ставится в эксплуатацию; при обновлении моделей связка «замер → фиксация → бой» повторяется.
Текстовая схема: базовая модель (16 бит) → конвертация в GGUF/AWQ под целевое железо → замер на контрольных задачах → версионирование весов → инференс (Ollama/vLLM) → API для систем заказчика.
| Формат | Цена | Срок |
|---|---|---|
| Аудит железа и подбор модели/квантования | от 90 000 ₽ | 3–5 рабочих дней |
| Пилот: квантованная модель + замеры + API | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: мониторинг дрейфа качества | 0,9–1,2 млн ₽ | 4–6 недель |
| Сопровождение и обновление моделей | от 50 000 ₽/мес | ежемесячно |
Совместимость с нашим стеком
Квантованные модели — «сердце» локального инференса, и вокруг них собирается привычный контур: генерация — открытые модели (Qwen, Llama, GigaChat Lite с открытыми весами) в GGUF/AWQ; хранение и поиск — pgvector или Qdrant/Milvus; API-слой — FastAPI; ответственность за формулировки — GigaChat API, когда облако допустимо.
Для 1С разницы нет: учётная система зовёт HTTP-эндпоинт, а что за ним — квантованная модель на офисном сервере или GPU-кластер. Схема интеграции — в гайде «Как интегрировать LLM в 1С».
Лицензии и импортозамещение
Инструменты квантования открыты: llama.cpp (GGUF) — MIT, AutoAWQ — открытая лицензия; сами форматы бесплатны и без роялти. Но лицензию несёт базовая модель: Qwen — Apache-2.0 (коммерческое использование), Llama — собственная лицензия сообщества с условиями, GigaChat Lite распространяется с открытыми весами на условиях её лицензии. В документацию поставки включаем лицензию именно базовой модели, а не только инструмента сжатия.
Для госсектора квантование — ключ к импортозамещению железа: модель, которая без сжатия требует дорогого GPU-сервера, после GGUF работает на отечественном CPU-сервере в закрытом контуре. Данные не покидают периметр, внешних вызовов нет.
Тонкости, которые всплывают в проектах
Первое — «квантование ≠ одна цифра»: Q4_K_M и Q4_0 ведут себя по-разному; уровень сжатия подбирается с задачей, а не по советам с форумов. Второе — деградация неравномерна: модель может отлично суммаризировать и начать путаться в числах и датах — контрольные задачи делают вслепую видимыми. Третье — источник весов: качайте только из проверенных репозиториев и фиксируйте хеши; «такой же файл» из чата может оказаться битым или чужим. Четвёртое — считайте память с запасом на контекст: длинные запросы съедают видеопамять сверх весов. Как выбирать модель под задачу — в гайде «Как выбрать LLM для компании».
Как считаем выгоду от квантования
Экономику сжатия считаем честно, на цифрах конкретного проекта. Исходная модель 7B в 16 битах занимает около 14–15 ГБ памяти под веса — плюс резерв на контекст. В Q4 та же модель — 4–5 ГБ. Практический вывод номер один: карта на 24 ГБ, которая держала одну 16-битную копию, в 4-битном варианте держит модель с запасом на длинный контекст и больше параллельных запросов. Вывод номер два: там, где раньше требовалась GPU, после сжатия хватает 16–32 ГБ обычной оперативной памяти — а это уже офисный сервер, а не закупка ускорителя.
Вторая часть расчёта — пропускная способность. На CPU квантованная модель считает заметно быстрее: меньше данных перекачивается из памяти, больше слоёв умещается в кэш. Для транскрибации протоколов и батч-обработки документов это разница между «ночь» и «пару часов». На GPU выигрыш меньше по латентности одного запроса, зато выше параллелизм на карте.
Третья часть — качество. Мы не принимаем решение по средним цифрам из интернета: контрольная выборка задач заказчика прогоняется на обеих версиях, результаты сравниваются по заранее согласованным критериям. Если просадка в пределах шума — берём сжатие; если модель начала путаться в ключевых полях — берём старший уровень квантования или большую модель в том же объёме памяти.
Про выбор степени сжатия без фанатизма: между Q4 и Q8 есть ступени, и на критичных задачах разница между ними видна в цифрах замеров. Наша практика: стартуем с Q4_K_M/Q5 для GGUF и 4-битного AWQ для GPU; если замер показывает просадку на ключевых полях — поднимаемся на ступень, теряя часть экономии памяти. Обратно — никогда не жертвуем задачей ради «ещё компактнее»: сжатие — средство, а не цель.
И про сроки: сам прогон «кандидаты → замер → фиксация» укладывается в одну–две недели стенда; дальше контур собирается как обычная интеграция. Итог для заказчика звучит просто: та же модель, то же качество на ваших задачах — но на железе, которое у вас уже есть, или на железе в полтора-два раза дешевле планируемого.
Как стартуем
- Пришлите характеристики железа (CPU/RAM или GPU) и описание задачи — предложим кандидатов под ваш лимит памяти.
- На стенде прогоним пару «оригинал против квантованной» на ваших примерах — покажем таблицу качества и скорости.
- Смета пилота — от 480 000 ₽ за 4–6 недель; КП за 1 рабочий день.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.