Выбор между батчем и реалтаймом — это выбор экономики: пакетная обработка считает тот же объём в разы дешевле, потому что железо загружается ровно, а очередь не требует SLA на секунды. Реалтайм нужен там, где человек смотрит на экран и ждёт: чат, голос, интерактивный поиск. Половина ИИ-проектов переплачивает за реалтайм просто потому, что архитектуру выбрали до вопроса «кто и когда ждёт ответ».
Ниже — таблицы «когда что» и критериев. Смежные материалы: «LLM-роутинг или одна модель» и «Kubernetes или простой сервер для LLM»; технический базис — статьи словаря «батч-инференс» и «латентность инференса».
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Что выбрать | Почему |
|---|---|---|
| Обработка архивов и накопленных документов | батч | никто не ждёт: очередь, ночная обработка, минимальная цена |
| Диалог в чате, голосовой канал, телефония | реалтайм | задержка видна пользователю напрямую |
| Ежедневные отчёты и дайджесты | батч | дедлайн — утро, а не секунда |
| Поиск по базе в интерфейсе сотрудника | реалтайм | ожидание ответа — часть опыта |
| Скоринг заявок при подаче | реалтайм с лимитом | клиент ждёт решение на экране |
| Периодическое обогащение данных CRM/ERP | батч | результат нужен к началу рабочего дня |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | Батч-обработка | Реалтайм-инференс |
|---|---|---|
| Стоимость на объёме | минимальная: ровная нагрузка, пакетные тарифы | выше: мощность держится под пики |
| Задержка | минуты–часы, по расписанию | секунды, в момент запроса |
| SLA | по окну обработки, легко исполнять | по латентности и доступности, дороже в разы |
| Архитектура | очередь, воркеры, мониторинг очереди | горячий контур, автоскейлинг, деградация |
| Пики нагрузки | сглаживаются очередью | требуют запаса мощности |
| Надёжность | повтор нестрашен: перезапуск задачи | сбой виден пользователю мгновенно |
| 152-ФЗ и данные | журналы пакетов, проще аудит | потоковые журналы, выше требования |
Главная строка — задержка в связке с вопросом «кто ждёт»: всё, чего никто не ждёт, уводите в батч и экономите кратно. Строка архитектуры показывает цену реалтайма — он требует горячего контура, а не только хорошей модели.
Разбор критериев
Экономика: где сидит экономия
Батч покупает инференс по расписанию: ночью железо загружено полностью, тарифы пакетной обработки у облачных провайдеров ниже поточных, а очередь сглаживает пики. Реалтайм платит за готовность: мощность держится под пик даже ночью, резервируется отказоустойчивость, SLA считается в секундах. На больших объёмах одинаковая задача в батче и реалтайме отличается по счёту в разы; что входит в полную стоимость контура, разбирает гайд «TCO ИИ-решения».
Задержка и опыт пользователя
Единственный честный аргумент реалтайма — человек, который ждёт. Чат, телефония, интерактивный поиск: каждые лишние секунды измеримо портят опыт. Всё остальное — документы, отчёты, скоринг заявок не «на экране», обогащение данных — не требует секунд: достаточно окна в минуты или часы. Проверочный вопрос к любой задаче: «что случится, если ответ придёт через 30 минут?» Если ответ «ничего» — это батч.
Архитектура и надёжность
Батч-контур — очередь, воркеры, мониторинг глубины очереди и повтор при сбое: упавшая задача перезапускается без последствий. Реалтайм — горячий сервис с автоскейлингом, таймаутами, деградацией и резервированием: любой сбой виден пользователю мгновенно. Пилот контура — от 480 000 ₽; промышленная система с SLA — от 690 000 ₽. Как инфраструктура влияет на сопровождение — в ответе на вопрос «что такое SLA на ИИ-систему».
Пиковые нагрузки
Реалтайм обязан держать максимум: утренний пик обращений в поддержку означает мощность под пик, простаивающую остальной день. Батч перемешивает и выравнивает: пиковая задача просто ждёт в очереди дольше на минуты. Отсюда типовая экономика контакт-центров: типовые обращения — в реалтайм-бот, ночная доразметка и аналитика разговоров — батчем; как это складывается на практике — «речевая аналитика».
Гибрид: реалтайм-вход, батч-доработка
Продуктивная схема 2026 года: пользовательский запрос обслуживается быстро и минимально, а полная обработка уходит в пакет. Пример: обращение классифицируется в реалтайме и получает черновой ответ, полный разбор, обогащение профиля и отчётность досчитываются батчем ночью. Так пользовательский SLA держится дешёвой моделью, а дорогой счёт за токены уходит в пакетный тариф; смежной экономикой занимается «роутинг моделей».
152-ФЗ и журналы
Батч упрощает аудит: пакеты нумеруются, журналы целостны, персональные данные проходят обработкой окнами с понятными границами. В реалтайме журналирование потоковое и объёмнее, требования к защите канала выше — данные движутся постоянно. Для регулируемых сред батч по умолчанию проще защищать и проверять; порядок проверок — в гайде «как подготовить компанию к проверке 152-ФЗ».
Вердикты по трём сценариям
Сценарий 1. Документооборот и архивы
Чистый батч: очередь, ночная обработка, мониторинг глубины. Пилот — от 480 000 ₽; экономия против реалтайма на том же объёме — кратно. Окно обработки фиксируется в SLA по времени готовности, а не по латентности.
Сценарий 2. Клиентские каналы: чат и телефония
Реалтайм с деградацией: горячий контур от 690 000 ₽, таймауты, фолбэк на более простую модель при пике. Ночная аналитика и доразметка — батчем; так дорогой контур работает только там, где его видит пользователь.
Сценарий 3. Смешанная система
Гибрид: реалтайм-вход с быстрым черновиком, полная обработка — пакетом. Архитектура одного контура с двумя режимами обойдётся от 690 000 ₽ и закрывает оба SLA без двойной инфраструктуры.
Типичные ошибки выбора
Ошибки режима инференса, которые незаметно удваивают счета.
- Реалтайм «на всякий случай»: пользователь не ждёт, а мощность держится под пик.
- SLA по латентности там, где нужен SLA по окну готовности.
- Очередь без идемпотентности: повтор задачи плодит дубли обработок.
- Нет режима деградации: пик валит горячий контур целиком.
- Журналы батча и реалтайма в разных системах: аудит не собирает единую трассу.
Итог
Режим инференса — это экономика, а не технология: всё, чего никто не ждёт, считайте батчем. Гибрид «быстрый черновик в реалтайме, полная обработка пакетом» закрывает опыт пользователя и счёт за токены одновременно. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Для каждой задачи ответьте: «что случится, если ответ придёт через 30 минут?»
- Разделите потоки: пользовательские — реалтайм, фоновые — батч.
- Посчитайте стоимость пакета против горячего контура на прогнозном объёме.
- Зафиксируйте SLA правильно: латентность — только там, где её видят.
- Спроектируйте очередь: повторы, идемпотентность, мониторинг глубины.
- Определите режим деградации реалтайма на пиках: фолбэк-модель, таймауты.
- Сведите журналы обоих режимов в одну трассу для аудита (152-ФЗ).
Смежные материалы
Смежные сравнения: «LLM-роутинг или одна модель» и «Kubernetes или простой сервер для LLM». Технологии: «vLLM-serving» и «речевая аналитика». Словарь: «батч-инференс» и «латентность инференса». Гайд: «TCO ИИ-решения».
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.