За аббревиатурами SLM и LLM стоит практический вопрос бюджета: маленькая языковая модель работает на скромном железе и стоит копейки за запрос, большая — требует серьёзных ресурсов, но тянет сложные задачи. Выбор «маленькая или большая» — это выбор того, какие процессы автоматизировать и как платить за инференс.
Ниже — сравнение по критериям стоимости, сроков, рисков, поддержки, комплаенса и данных. Про выбор между облаком и собственным контуром — «облачный LLM или on-premise»; про запуск моделей в своём контуре — «Ollama или vLLM».
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Что выбирать | Почему |
|---|---|---|
| Классификация и разметка потока обращений | SLM | дёшево, локально, стабильное качество |
| Извлечение полей из документов | SLM (+ правила) | узкая задача не требует большой модели |
| Сложные ответы, рассуждения, длинный контекст | LLM | качество важнее стоимости запроса |
| Клиентский ассистент с широтой вопросов | LLM (или гибрид) | плохой ответ дороже дорогого токена |
| Ограниченное железо и бюджет | SLM | работает на CPU и одной GPU |
| Персональные данные в каждом запросе | локальная SLM или LLM | контур без внешних вызовов |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | Малые модели (SLM) | Большие модели (LLM) |
|---|---|---|
| Стоимость инференса | низкая: массовые процессы без заметных счетов | выше; в облаке — токены, в контуре — GPU-парк |
| Сроки | дни на типовую задачу классификации | дни на API, недели на свой контур |
| Риски | переоценка способностей на сложных задачах | стоимость, задержки, галлюцинации без guardrails |
| Поддержка | простой стек, легко менять модель | контур LLM требует инженерии и мониторинга |
| 243-ФЗ | ИИ-актив в реестре, описание простое | ИИ-актив с регламентом, оценками рисков, журналами |
| Данные | легко держать локально даже на рабочей станции | локально — нужен сервер/кластер; облако — данные у провайдера |
| Качество на сложных задачах | ограниченное: тонкие инструкции соблюдает хуже | высокое: следует контексту и нюансам |
Как читать матрицу: строка «Качество на сложных задачах» — не приговор малым моделям, а граница их применения: её определяет тестовая выборка, а не интуиция; практичный тест: если человек решает задачу по памятке из одного экрана — почти наверняка хватит малой модели. Строки «Стоимость» и «Данные» часто сходятся: дешёвый локальный инференс одновременно оказывается самым закрытым контуром, а на месячном потоке операций малая модель экономит заметные суммы даже при скромной разнице в цене вызова. Строка «243-ФЗ» одинакова по требованиям к обеим колонкам, но объём документации у узкой SLM-задачи заметно меньше, чем у агентной LLM-системы. Маршрутизацию закладывайте сразу: так сложные случаи не зависают, а дорогая модель работает только там, где она действительно нужна.
Разбор критериев
Стоимость инференса
Себестоимость запроса к SLM на порядок ниже: модель меньше, железо скромнее, latency ниже — массовые операции (разметка тысяч обращений, проверка тысяч полей) не создают заметных счетов. LLM оправдывает стоимость там, где цена ошибки выше цены токена: клиентский диалог, юридический анализ, сложный поиск. Практичная экономика — маршрутизация: SLM обрабатывает поток, LLM получает только сложные случаи.
Сроки
Типовую задачу на SLM (классификация обращений по категориям) можно поставить за дни: модель, примеры, проверка качества. LLM-контур в облаке тоже подключается быстро, а вот LLM в собственном контуре — это уже проект с инфраструктурой и настройкой инференса. Если задача узкая, а срок горит, SLM почти всегда выигрывает гонку до первого результата.
Риски
Риск SLM — переоценка: модель справляется с демо, но тонет на живых данных со сложными формулировками. Риск LLM — стоимость и непредсказуемость: без лимитов и guardrails счёт за токены и галлюцинации растут вместе. Лечится одинаково — тестовой выборкой живых данных и метриками до промышленного запуска; про галлюцинации — «почему LLM галлюцинирует».
Поддержка и эволюция
Малые модели меняются легко: новая версия ставится вместо старой почти безболезненно, откат тривиален. Большие модели в контуре требуют дисциплины: версии, совместимость промптов, регрессионные тесты, мониторинг дрейфа. Промежуточный инструмент — квантование: большая модель сжимается и запускается на меньшем железе, занимая середину между SLM и полноразмерной LLM
Комплаенс: 243-ФЗ и реестр
Любая языковая модель в производственном процессе Москвы в рамках эксперимента по 243-ФЗ — ИИ-актив: реестр, назначение, границы применения. У SLM описание проще: узкая задача, фиксированные входы-выходы. У LLM-систем регламент серьёзнее: сценарии использования, оценка рисков, журналирование. Это не аргумент против больших моделей — это плановая работа, методика которой изложена в гайде по реестру ИИ-активов.
Данные и приватность
SLM целиком умещается в защищённом контуре вплоть до рабочей станции — для персональных данных это самый простой режим. LLM локально требует сервера и инженерии; облачная LLM отправляет данные провайдеру. Отсюда типовое решение для чувствительных потоков: локальная SLM на потоке ПДн + LLM на обезличенной агрегации, где нужны сложные рассуждения. Нужна ли вам своя модель вообще — разбор «нужна ли бизнесу собственная языковая модель».
Вердикты по трём сценариям
Сценарий 1. Поток документов: извлечение и проверка полей
SLM плюс правила валидации: модель извлекает, правила проверяют, сомнительные документы уходят человеку. LLM подключается только для сложных случаев (таблицы, рукописные оговорки). Такой конвейер — типовое содержание пилота от 480 000 ₽.
Сценарий 2. Сортировка обращений и тикетов
SLM-классификатор на входе: тематика, срочность, маршрут. Экономия часов команды начинается в первую неделю; качество контролируется выборочной проверкой и метриками согласованности.
Сценарий 3. Внутренний ассистент по базе знаний
LLM с RAG: длинный контекст, работа с нюансами вопросов, ссылки на источники. Если данные чувствительные — та же LLM в собственном контуре (0,9–1,2 млн ₽ под ключ); для массовых простых вопросов перед ней можно поставить SLM-фильтр.
Типичные ошибки выбора
Ошибки при выборе размера модели:
- мерить SLM на синтетических примерах вместо живого потока данных;
- отдавать малой модели задачи, требующие длинных рассуждений и нюансов контекста;
- закупать GPU-парк до расчёта реальной нагрузки — часто хватает одной карты или CPU;
- не проектировать маршрутизацию SLM → LLM и получать затор на сложных случаях;
- забывать регрессионные тесты при смене версий моделей — качество меняется незаметно.
Итог
Размер модели — это распределение бюджета по задачам, а не вера в один абсолют. Малые модели забирают массовые простые операции почти бесплатно, большие — работают там, где цена ошибки и сложность рассуждения высоки. Маршрутизация между ними — стандартная архитектура, которая в 2026 году выгоднее обеих крайностей. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Перечислите задачи по потокам: что массовое и простое (SLM), что редкое и сложное (LLM).
- Соберите тестовую выборку живых данных и фиксируйте метрики до выбора модели.
- Посчитайте стоимость инференса на месячный объём, а не на один запрос.
- Проверьте требование к данным: локальный режим, обезличивание, облако допустимо?
- Заложите маршрутизацию: SLM первым, LLM на эскалации.
- Определите процедуру замены модели на новую версию (регрессионные тесты).
- Внесите модели в реестр ИИ-активов, если работаете в рамках 243-ФЗ.
Смежные материалы
Смежные сравнения: «облачный LLM или on-premise» и «отечественные LLM или GPT». Практика: услуги LLM-интеграций и ИИ-ассистентов; технология Ollama: локальный LLM. Вопросы: «нужна ли бизнесу собственная языковая модель». Пошагово: «как выбрать LLM для компании».
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.