Как работает дистилляция моделей
Идея родом из образования: лучший способ научить новичка — не дать ему выучить учебник наизусть, а посадить рядом с опытным наставником и смотреть, как тот решает задачи. При дистилляции роль наставника играет большая модель-«учитель», а новичка — компактная модель-«ученик», которая учится воспроизводить не только итоговые ответы, но и сам ход их получения.
- Генерация учебного материала. Большая модель-учитель обрабатывает массив типовых задач: классифицирует обращения, размечает документы, отвечает на вопросы домена.
- «Мягкие» метки. Ученик получает не только правильный ответ, но и распределение вероятностей учителя — какие альтернативы были близки. В этих оттенках и содержится главное знание.
- Обучение ученика. Компактная модель тренируется приближаться к учителю на этом материале; для узкой задачи её архитектуры хватает, чтобы удержать существенную долю качества.
- Эксплуатация. В продакшен выходит ученик: в разы меньше памяти и вычислений, а качество на задачах домена — близкое к учителю.
Дистилляция среди других способов удешевить модель
| Метод | Что уменьшает | Что теряется | Когда выбирают |
|---|---|---|---|
| Квантизация | Точность чисел в весах | Незначительное качество | Быстро ужать готовую модель |
| Дистилляция | Сама модель — обучается компактная | Универсальность, часть качества | Узкая задача с большим потоком |
| LoRA-адаптеры | Объём дообучения | Размер базы не меняется | Настроить поведение под домен |
| Роутинг | Число обращений к дорогой модели | Ничего, если пороги верны | Смешанный поток запросов |
Методы сочетаются: дистиллированную компактную модель затем квантуют и поднимают локально — так получается самый дешёвый инференс при приемлемом качестве. Отличие дистилляции от fine-tuning принципиальное: fine-tuning доучивает большую модель на ваших данных, дистилляция же создаёт маленькую копию большой для поточных задач.
Где дистилляция встречается в бизнес-задачах
- Классификация обращений и тикетов. Учитель — топовая модель, ученик — компактный классификатор, который за копейки размечает весь входящий поток, а сомнительные случаи эскалирует.
- Разметка документооборота. Тип документа, извлечение реквизитов, маршрутизация по процессу — узкие задачи с миллионами повторений, идеальная среда для ученика.
- Локальный контур. Дистиллят на одном-двух серверах закрывает чувствительные сценарии без облака — продолжение линии on-premise LLM.
- Первичный фильтр в RAG. Компактная модель-ученик быстро оценивает релевантность фрагментов, а финальный ответ собирает большая модель — конвейер дешевеет без потери итогового качества RAG-пайплайна.
Ограничения и тонкости
Узость. Ученик хорош ровно там, где учил: попытка использовать дистиллят «не по специальности» быстро показывает падение качества — это не универсальная модель, а рабочий инструмент под процесс. Порог входа. Нужны данные и вычислительный бюджет на обучение; при малых объёмах задач проще взять готовую компактную модель и промпт. Наследование недостатков. Ученик перенимает и ошибки учителя, включая галлюцинации на редких темах — материал обучения проходит контроль качества. Сопровождение. При смене процесса или регламента ученика переучивают: в отличие от правки промпта, это цикл с подготовкой данных и валидацией.
Сколько стоит (сентябрь 2026)
Прототип (готовый дистиллят открытой модели под задачу, оценка качества на вашей выборке) — от 90 000 ₽; пилот с генерацией учебного материала от учителя, обучением ученика и сравнением экономики — от 480 000 ₽; промышленный контур с сопровождением, переобучением и мониторингом дрейфа — от 690 000 ₽. Практика квантования и локального запуска моделей — в обзорах квантования GGUF/AWQ и локального LLM через Ollama.
Как начать
Посчитайте объём повторяющихся однотипных обращений к модели за месяц и долю типовых среди них. Если поток большой, а задача узкая — дистилляция окупится: ученик работает в разы дешевле учителя. Выбор базовых моделей для учителя и ученика — обзор open-source LLM для бизнеса; встраивание в процессы — LLM-интеграции.