Как работает LLM-роутинг
Идея проста: не гнать весь поток запросов через одну «самую умную» модель, а распределить запросы по моделям под их сложность и чувствительность. Роутер — это слой между приложением и провайдерами моделей, который принимает решение за миллисекунды и прозрачен для пользователя.
- Правила. Самый предсказуемый уровень: темы, источники, типы данных. «Запросы с ПДн — только локальная модель», «вопросы по регламентам — RAG-модель с базой знаний», «остальное — облачная».
- Классификатор сложности. Компактная модель оценивает запрос: «адрес и график работы» — простое, «сравнить три договора и найти противоречия» — сложное.
- LLM-роутер. Сама модель читает запрос и называет маршрут. Гибко, но добавляет стоимость и требует контроля — на практике уровни комбинируют: правила про данные жёсткие, сложность оценивает классификатор.
- Fallback. Если выбранная модель недоступна или превысила лимит — запрос автоматически уходит по цепочке запасных маршрутов.
Как запросы распределяются по моделям
| Класс запроса | Доля типового потока | Маршрут |
|---|---|---|
| Типовые вопросы (адрес, статус, график) | Большая часть обращений | Быстрая дешёвая модель |
| Вопросы по документам компании | Средняя | RAG-контур с базой знаний |
| Сложный анализ, юридические сюжеты | Меньшая | Мощная модель верхнего сегмента |
| Запросы с персональными данными | По комплаенсу | Локальная модель в контуре |
| Черновики и внутренние задачи | Фоновая | Открытая модель на своём железе |
Экономика в том, что большинство обращений к корпоративному ассистенту — простые. Когда они идут через дешёвый маршрут, а дорогая модель включается только там, где нужна, итоговый счёт за токены снижается кратно — без потери качества ответов, если пороги сложности настроены по тестовому набору.
Где LLM-роутинг встречается в бизнесе
- Поточные ассистенты поддержки. Тысячи обращений в день: типовые закрываются малой моделью за доли секунды, сложные эскалируются.
- Гибридные контуры «облако + локально». Чувствительные данные клиентов — на on-premise-модели, остальное — в российском облаке через GigaChat API; роутер соблюдает границы автоматически.
- Отказоустойчивость. Fallback-цепочки защищают от лимитов, тарифных изменений и простоев конкретного API — сервис продолжает отвечать.
- Мультиагентные системы. В схемах оркестрации агентов роутинг — стандартный слой диспетчеризации: какой агент (и на какой модели) возьмёт задачу.
Риски и тонкости
Ошибка маршрутизации. Сложный вопрос ушёл на простую модель — пользователь получил слабый ответ. Лечится калибровкой порогов на тестовом наборе и мониторингом: доля «переприоритизированных» запросов (когда маршрут пришлось менять после первого ответа) — ключевая метрика качества роутера. Прозрачность для команды. Правила маршрутов должны быть задокументированы и версионируемы — иначе через полгода никто не помнит, почему «эти запросы идут туда». Стоимость самого роутера. Классификатор тоже ест ресурсы; он должен быть на порядки дешевле того, что экономит.
Сколько стоит (сентябрь 2026)
Прототип роутинга (правила + один классификатор, две модели) — от 90 000 ₽; пилот с fallback-цепочками, мониторингом и интеграцией в действующего ассистента — от 480 000 ₽ за 4–6 недель; промышленный слой с мультиагентной диспетчеризацией — от 690 000 ₽. Отдельная экономика — эксплуатация: сниженный токен-бюджет обычно окупает внедрение в первые месяцы поточного сервиса.
Как начать
Разберите лог существующего ассистента (или типовые вопросы процесса) и разделите запросы на классы: сколько простых, сколько сложных, сколько чувствительных. По этой структуре видно, даст ли роутинг экономию, и какие маршруты нужны в первую очередь. Внедрение — LLM-интеграции; обзоры моделей для маршрутов — в open-source LLM для бизнеса.