Архитектурные споры «монолит против микросервисов» обострились с приходом LLM: инференс на GPU живёт по другим правилам, чем обычный веб-слой. Ответ 2026 года прагматичен: важен не счёт сервисов, а границы.
Сравнение подходов
| Критерий | Модульный монолит | Микросервисы |
|---|---|---|
| Разработка | быстрее: один репозиторий, простые вызовы | больше церемоний: контракты, версионирование |
| Отладка | трассировка в одном процессе | распределённые трассировки и корреляция |
| Эксплуатация | один деплой и пайплайн | оркестрация, сеть, мониторинг каждого сервиса |
| Масштабирование | весь код растёт вместе | точечное: GPU отдельно от веба |
| Команды | одна-две команды | несколько независимых команд |
| Отказоустойчивость | падение тянет всё | изолируется по сервису |
Ключевой паттерн — шлюз инференса
Даже в монолите LLM-вызовы выносят в отдельный шлюз: он держит очередь, ретраи, лимиты и подмену моделей (GigaChat, YandexGPT, локальная — конфигурацией). Так нагрузка на GPU не роняет веб-слой, а смена провайдера не трогает бизнес-код. Инфраструктуру этого слоя разбирает материал про GPU-инференс; движок внутри — «Ollama или vLLM».
Чек-лист выбора
- Размер команды — одна-две команды продуктивнее на модульном монолите: меньше синхронизации, быстрее релизы.
- Режимы нагрузки — GPU-инференс и веб-слой масштабируются по-разному: это главный честный аргумент за выделение сервисов.
- Контуры безопасности — данные с разными требованиями лучше разводить по периметрам, а не по папкам в коде.
- Скорость релизов — ежедневные деплои всего монолита утомляют быстрее, чем появляется ценность.
- Стоимость DevOps — каждый микросервис — это пайплайн, мониторинг и дежурство; умножьте на плановое число сервисов.
- Планы роста — границы модулей проектируйте так, чтобы завтра их можно было вырезать в сервисы без переписывания.
Практическое правило для LLM-проектов: пилот и MVP — монолит с шлюзом инференса; выделение микросервисов — по факту измеренной нагрузки и роста команд, а не по архитектурной моде. Каждый новый сервис должен оправдываться цифрами — стоимостью простоя, скоростью релизов или изоляцией отказа. Документируйте границы модулей и контракты между ними: они переживают любую миграцию и любую смену архитектурной моды.
Когда всё же микросервисы
- Разные режимы масштабирования: вечерние пики инференса при ровном веб-трафике.
- Несколько команд: продуктовые домены развиваются независимо.
- Разные контуры безопасности: изолированный контур с ПДн рядом с публичным API.
Для старта порядок другой: MVP или пилот (от 480 000 ₽, см. «MVP или полная система»), модульный монолит с шлюзом, микросервисы — по мере роста команд. Общий путь внедрения — FAQ «как внедрить LLM в компанию»; услуга — LLM-интеграции.