Как работает смесь экспертов
Обычная («плотная») модель при обработке каждого фрагмента текста задействует все свои параметры целиком: чем больше модель знает — тем дороже стоит каждый её ответ. В архитектуре «смесь экспертов» внутри одной модели обучаются десятки специализированных подсетей-экспертов, а рядом с ними — маленький маршрутизатор (router). Для каждого входящего фрагмента текста маршрутизатор оценивает, какие эксперты «профильные» именно для него, и будит лишь несколько (обычно 2 из 64 или 8 из 256).
- Обучение. Модель учится на текстах; маршрутизатор одновременно учится «раздавать» фрагменты экспертам так, чтобы никто не простаивал и никто не перегружался.
- Инференс. На каждый фрагмент текста активируются только выбранные эксперты; остальные веса лежат в памяти, но не считают.
- Результат. Суммарные знания модели — как у гиганта, а вычислений на запрос — как у модели в несколько раз меньше.
Термин не новый: идея смеси экспертов описана ещё в 1991 году, но массовой она стала в больших языковых моделях поколения Mixtral, DeepSeek и Qwen, где счёт экспертам идёт на десятки и сотни.
| Критерий | Плотная модель | Смесь экспертов (MoE) |
|---|---|---|
| Активные параметры на запрос | Все | Небольшая доля (например, 10–20%) |
| Стоимость инференса | Растёт вместе с размером | Почти не растёт при росте «знаний» |
| Память (VRAM) | Пропорциональна размеру | Нужна под всех экспертов сразу |
| Дообучение | Отработано | Сложнее: нужен баланс загрузки экспертов |
| Кому подходит | Универсальные API-модели | Локальные контуры, потоковые сервисы |
Где MoE встречается в бизнесе
- Локальные LLM в контуре. Открытые MoE-модели — рабочий способ получить качество «большой» модели на 2–3 GPU-ускорителях: для ПДн и гостайны это почти единственный путь к сильному ИИ без облака (подробнее — on-premise LLM).
- Потоковые ассистенты. Когда чат-бот обслуживает тысячи обращений в день, разница в стоимости токена между плотной и MoE-моделью превращается в заметную статью экономии.
- Продакшен-инференс. Серверы инференса вроде vLLM умеют обслуживать MoE-модели эффективно, скрывая особенность архитектуры от прикладного кода (практика — vLLM serving).
- Российские и открытые стеки. Большинство современных открытых моделей (Qwen, DeepSeek, Mixtral) выпускаются именно в MoE-исполнении — знание термина нужно уже на этапе выбора модели (обзор — open-source LLM для бизнеса).
Сильные стороны и ограничения
Сильные стороны. Экономия вычислений на каждом запросе; возможность держать «знающую» модель на скромном железе; быстрый отклик, потому что считает лишь часть сети. В связке с квантизацией MoE даёт самый дешёвый локальный инференс из доступных сегодня.
Ограничения. Память: даже «спящие» эксперты должны лежать в VRAM, поэтому MoE-модель с общим объёмом 100+ млрд параметров не запустить на ноутбуке — только на серверном ускорителе. Дообучение сложнее: при несбалансированной загрузке маршрутизатор «слипается» на нескольких экспертах, и преимущество архитектуры теряется. Наконец, поведение MoE-моделей чуть менее предсказуемо при тонкой настройке — важный аргумент в пользу пилотных испытаний на своих данных.
Сколько стоит контур на MoE-модели (сентябрь 2026)
Прототип сценария на открытой MoE-модели (классификация, суммаризация, черновой ассистент) — от 90 000 ₽; пилот с интеграцией в процессы заказчика — от 480 000 ₽ за 4–6 недель; MVP ассистента с RAG и подключением к 1С/CRM — от 690 000 ₽. Железо считается отдельно и зависит от нагрузки: для старта пилота обычно хватает одной серверной GPU-конфигурации. Для сравнения: годовое сопровождение нейросетевой системы в госсекторе по рынку сентября 2026 — около 630 000 ₽.
Как начать
Правильный старт — не с выбора модели, а с задачи: берётся один процесс с измеримым результатом (например, первая линия поддержки), собирается тестовый набор из 50–100 реальных обращений, и на нём сравниваются плотная и MoE-модель по качеству, скорости и стоимости. Внедрением таких контуров занимается в том числе LLM-интеграции от ООО «НЬЮ-ССТ»; смежная архитектурная тема — трансформеры, базовая архитектура, внутри которой живут эксперты.