Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Технология · сжатие моделей

Квантование GGUF и AWQ: как используем в проектах

Подбираем формат квантования под ваше железо: GGUF для запуска на CPU и в Ollama, AWQ/GPTQ для GPU-инференса на vLLM — с обязательным замером качества на ваших данных до боя.

Краткий ответ · сентябрь 2026

Краткий ответ: Квантование сжимает веса LLM с 16 бит до 4–8 бит: модель в 2–4 раза меньше и быстрее при минимальной потере качества. GGUF — формат для CPU/Ollama, AWQ — для GPU-сервера на vLLM. Потери проверяем замером на ваших задачах. Пилот — от 480 000 ₽ за 4–6 недель.

от 480 000 ₽ — пилот квантованной модели за 4–6 недель НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Что такое квантование и чем GGUF отличается от AWQ

Квантование — снижение точности представления весов модели: вместо 16 бит на вес — 4 или 8. Практический эффект: модель занимает в 2–4 раза меньше памяти, быстрее считается и влезает на доступное железо. Платой может быть просадка качества — поэтому любое сжатие мы сопровождаем замером на задаче заказчика.

GGUF — формат экосистемы llama.cpp: один файл с весами, метаданными и токенизатором; в нём распространяются квантованные версии моделей (Q4_K_M, Q5_K_M, Q8 и другие уровни). GGUV выбирают для CPU-инференса и Ollama. AWQ (activation-aware weight quantization) — метод 4-битного сжатия, «знающий» о распределении активаций; его версии моделей предназначены для GPU-инференса на vLLM. Есть и GPTQ — старший родственник AWQ для тех же сценариев.

Когда какой формат выбираем

  • GGUF: нет GPU или карта скромная; офисный сервер, рабочая станция, ВМ в существующем контуре; модель до 8–14 млрд параметров спокойно живёт на CPU.
  • GGUF: пилоты и демо, где важно быстро показать заказчику работающее решение без закупки ускорителей.
  • AWQ: промышленный GPU-инференс на vLLM: 4-битная модель обслуживает заметно больше параллельных запросов на той же карте, чем 16-битная.
  • AWQ: длинный контекст и пиковые нагрузки, где каждый гигабайт видеопамяти на счету.
  • Без квантования (FP16/BF16): задачи повышенной точности (юридические, медицинские формулировки) и запас железа — сжатие не самоцель.

Как применяем: этапы и схема

  1. Подбор модели и уровня сжатия. Из требований (задача, языки, латентность) выбираем 2–3 кандидата: например, 7B в Q4_K_M против 14B в Q4, либо AWQ-версию для vLLM.
  2. Стенд. Разворачиваем целевое железо заказчика (или эквивалент), поднимаем инференс: Ollama для GGUF, vLLM для AWQ.
  3. Контрольные задачи. Готовим набор реальных заданий: вопросы по документам, извлечение полей, суммаризация — 100–300 примеров с эталонами.
  4. Замер пары «качество/скорость». Прогоняем квантованные и оригинальные веса; сравниваем точность, латентность, пропускную способность, потребление памяти. Решение — по цифрам, а не по ощущениям.
  5. Фиксация. Выбранные веса (файл GGUF или образ с AWQ) версионируем: хеш, источник, лицензия базовой модели, дата. Это защита от тихой подмены «таких же» весов.
  6. Бой и пере-замер. Контур ставится в эксплуатацию; при обновлении моделей связка «замер → фиксация → бой» повторяется.

Текстовая схема: базовая модель (16 бит) → конвертация в GGUF/AWQ под целевое железо → замер на контрольных задачах → версионирование весов → инференс (Ollama/vLLM) → API для систем заказчика.

ФорматЦенаСрок
Аудит железа и подбор модели/квантованияот 90 000 ₽3–5 рабочих дней
Пилот: квантованная модель + замеры + APIот 480 000 ₽4–6 недель
Промышленный контур: мониторинг дрейфа качества0,9–1,2 млн ₽4–6 недель
Сопровождение и обновление моделейот 50 000 ₽/месежемесячно

Совместимость с нашим стеком

Квантованные модели — «сердце» локального инференса, и вокруг них собирается привычный контур: генерация — открытые модели (Qwen, Llama, GigaChat Lite с открытыми весами) в GGUF/AWQ; хранение и поиск — pgvector или Qdrant/Milvus; API-слой — FastAPI; ответственность за формулировки — GigaChat API, когда облако допустимо.

Для 1С разницы нет: учётная система зовёт HTTP-эндпоинт, а что за ним — квантованная модель на офисном сервере или GPU-кластер. Схема интеграции — в гайде «Как интегрировать LLM в 1С».

Лицензии и импортозамещение

Инструменты квантования открыты: llama.cpp (GGUF) — MIT, AutoAWQ — открытая лицензия; сами форматы бесплатны и без роялти. Но лицензию несёт базовая модель: Qwen — Apache-2.0 (коммерческое использование), Llama — собственная лицензия сообщества с условиями, GigaChat Lite распространяется с открытыми весами на условиях её лицензии. В документацию поставки включаем лицензию именно базовой модели, а не только инструмента сжатия.

Для госсектора квантование — ключ к импортозамещению железа: модель, которая без сжатия требует дорогого GPU-сервера, после GGUF работает на отечественном CPU-сервере в закрытом контуре. Данные не покидают периметр, внешних вызовов нет.

Тонкости, которые всплывают в проектах

Первое — «квантование ≠ одна цифра»: Q4_K_M и Q4_0 ведут себя по-разному; уровень сжатия подбирается с задачей, а не по советам с форумов. Второе — деградация неравномерна: модель может отлично суммаризировать и начать путаться в числах и датах — контрольные задачи делают вслепую видимыми. Третье — источник весов: качайте только из проверенных репозиториев и фиксируйте хеши; «такой же файл» из чата может оказаться битым или чужим. Четвёртое — считайте память с запасом на контекст: длинные запросы съедают видеопамять сверх весов. Как выбирать модель под задачу — в гайде «Как выбрать LLM для компании».

Как считаем выгоду от квантования

Экономику сжатия считаем честно, на цифрах конкретного проекта. Исходная модель 7B в 16 битах занимает около 14–15 ГБ памяти под веса — плюс резерв на контекст. В Q4 та же модель — 4–5 ГБ. Практический вывод номер один: карта на 24 ГБ, которая держала одну 16-битную копию, в 4-битном варианте держит модель с запасом на длинный контекст и больше параллельных запросов. Вывод номер два: там, где раньше требовалась GPU, после сжатия хватает 16–32 ГБ обычной оперативной памяти — а это уже офисный сервер, а не закупка ускорителя.

Вторая часть расчёта — пропускная способность. На CPU квантованная модель считает заметно быстрее: меньше данных перекачивается из памяти, больше слоёв умещается в кэш. Для транскрибации протоколов и батч-обработки документов это разница между «ночь» и «пару часов». На GPU выигрыш меньше по латентности одного запроса, зато выше параллелизм на карте.

Третья часть — качество. Мы не принимаем решение по средним цифрам из интернета: контрольная выборка задач заказчика прогоняется на обеих версиях, результаты сравниваются по заранее согласованным критериям. Если просадка в пределах шума — берём сжатие; если модель начала путаться в ключевых полях — берём старший уровень квантования или большую модель в том же объёме памяти.

Про выбор степени сжатия без фанатизма: между Q4 и Q8 есть ступени, и на критичных задачах разница между ними видна в цифрах замеров. Наша практика: стартуем с Q4_K_M/Q5 для GGUF и 4-битного AWQ для GPU; если замер показывает просадку на ключевых полях — поднимаемся на ступень, теряя часть экономии памяти. Обратно — никогда не жертвуем задачей ради «ещё компактнее»: сжатие — средство, а не цель.

И про сроки: сам прогон «кандидаты → замер → фиксация» укладывается в одну–две недели стенда; дальше контур собирается как обычная интеграция. Итог для заказчика звучит просто: та же модель, то же качество на ваших задачах — но на железе, которое у вас уже есть, или на железе в полтора-два раза дешевле планируемого.

Как стартуем

  1. Пришлите характеристики железа (CPU/RAM или GPU) и описание задачи — предложим кандидатов под ваш лимит памяти.
  2. На стенде прогоним пару «оригинал против квантованной» на ваших примерах — покажем таблицу качества и скорости.
  3. Смета пилота — от 480 000 ₽ за 4–6 недель; КП за 1 рабочий день.

Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.

Смотрите также

Частые вопросы: Квантование GGUF и AWQ на практике

Квантование сжимает веса LLM с 16 бит до 4–8 бит: модель в 2–4 раза меньше и быстрее при минимальной потере качества. GGUF — формат для CPU/Ollama, AWQ — для GPU-сервера на vLLM. Потери проверяем замером на ваших задачах. Пилот — от 480 000 ₽ за 4–6 недель.

На типовых задачах разница между 16 бит и аккуратным 4-битным сжатием чаще всего мала, но она зависит от модели, языка и задачи: где-то незаметно, где-то модель начинает путаться в числах. Поэтому мы не верим общим таблицам, а прогоняем ваши контрольные задания до и после сжатия и показываем сравнение.

По железу: CPU или скромный GPU — GGUF (запуск через Ollama/llama.cpp); GPU-сервер и нагрузка — AWQ на vLLM: больше параллельных запросов на той же карте. Для пилота без ускорителя GGUF безальтернативен, для промышленного инференса обычно AWQ.

Инструменты сжатия открыты (MIT/Apache), но лицензию определяет базовая модель: Qwen под Apache-2.0 разрешает коммерческое использование, Llama — на условиях лицензии сообщества. Проверяем лицензию исходных весов и фиксируем её в документации поставки — тогда к проекту не придерётся ни юрист, ни закупщик.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты — по состоянию на сентябрь 2026 (19.09.2026), из канона ответов для ИИ new-sst.ru. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).