Вопрос «Kubernetes или просто сервер» встаёт перед каждым LLM-контуром: инфраструктура оркестрации стала фактическим стандартом облачных команд, но для большинства корпоративных ИИ-контуров — один-два сервиса, одна GPU-машина, предсказуемая нагрузка — она избыточна и создаёт постоянную нагрузку на команду. Развилка решается не модой, а тремя фактами: сколько сервисов, кто сопровождает, какие SLA.
Ниже — таблицы «когда что» и критериев. Технический базис: «Kubernetes для LLM» и «FastAPI-оркестрация»; смежная архитектурная развилка — «монолит против микросервисов с LLM».
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Что выбрать | Почему |
|---|---|---|
| Один-два сервиса, одна GPU-машина | простой сервер (docker-compose) | оркестрация добавит сложности без выгоды |
| Десятки сервисов, несколько команд | Kubernetes | планирование, изоляция, катления — его работа |
| Нет выделенной DevOps-команды | простой сервер | K8s без владельца деградирует быстро |
| Автоскейлинг под пиковую нагрузку | Kubernetes | горизонтальное масштабирование из коробки |
| Жёсткие SLA с переносом узлов | Kubernetes | самовосстановление и перекатывание подов |
| Закрытый контур с аудитом (187-ФЗ/КИИ) | минимальная архитектура | меньше компонентов — меньше поверхность проверки |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | Простой сервер | Kubernetes |
|---|---|---|
| Стоимость входа | контур от 690 000 ₽ без инфраструктурной надбавки | та же разработка плюс настройка кластера и его сопровождение |
| Требования к команде | любой инженер средней руки | нужен инженер K8s в штате или подряде |
| Масштабирование | вертикальное: сервер побольше | горизонтальное: автоскейлинг под нагрузку |
| Отказоустойчивость | перезапуск вручную, резервирование узлов | самовосстановление, дрейн узлов, катления |
| Сложность диагностики | логи и процессы на одной машине | много слоёв: поды, узлы, сети, контроллеры |
| Безопасность и 187-ФЗ | маленькая поверхность, простой аудит | богатые механизмы, но больше компонентов |
| Сопровождение | минимальное, предсказуемое | постоянное: версии, патчи, дрейф конфигурации |
Матрицу читайте через строку команды: Kubernetes без владельца — это не инфраструктура, а будущий инцидент. Строка стоимости входа одинакова не случайно — разработка контура не меняется, меняется только инфраструктурная надбавка и её сопровождение.
Разбор критериев
Считаем сервисы и нагрузку
Честный старт развилки — инвентаризация: сколько сервисов в контуре, сколько GPU, как выглядит пик. Один сервис инференса, векторная база и шлюз на одной машине — это docker-compose, и Kubernetes здесь купит только строчку в резюме подрядчика. Пятнадцать микросервисов, четыре команды и пиковые нагрузки — без оркестрации начинается ручной хаос. Смотрите также сравнение «монолит против микросервисов»: часто правильный ответ — упростить архитектуру, а не усложнять инфраструктуру.
Команда: главный скрытый критерий
Kubernetes — это не разовая настройка, а постоянная эксплуатация: версии кластера, патчи, дрейф конфигураций, диагностика через множество слоёв. Без инженера, который владеет кластером, через год вы получаете запущенную систему, которую боятся трогать. Простой сервер сопровождает любой инженер средней руки: логи на одной машине, процессы видны глазами. Вопрос «кто будет этим заниматься через год?» важнее любого списка функций; что входит в такое сопровождение — «что входит в сопровождение ИИ-системы».
Масштабирование и SLA
Реалтайм-нагрузка с пиками — сильная сторона оркестрации: автоскейлинг добавляет реплики под очередь, обновления катятся без простоя, упавшие поды поднимаются сами. Но у LLM есть особенность: GPU — дорогой и штучный ресурс, и «масштабирование» чаще означает вертикаль (более мощная карта) или батч-режим (см. «батч или реалтайм»), а не десятки мелких реплик. Часто SLA закрывается двумя мощными узлами и честным резервированием — без кластера.
Стоимость владения
Сервер стоит понятно: железо или аренда, электричество, поддержка. Кластер добавляет свою статью: настройка, управляющие слои, резервирование узлов, инженерное время. Для контура от 690 000 ₽ разработки инфраструктурная надбавка за K8s может сравняться со стоимостью самой разработки. Модельный пример: пилот 480 000 ₽ плюс промышленный контур 690 000 ₽ дают 1 170 000 ₽ за два этапа на простом сервере — без кластерной надбавки (модельный пример). Методика полной стоимости — гайд «TCO ИИ-решения».
Безопасность, 152-ФЗ и 187-ФЗ
Меньше компонентов — меньше поверхность проверки: на простом сервере аудит видит процессы, порты и журнал одной машины. Кластер даёт сильные механизмы — политики, сегрегацию, шифрование секретов, — но каждый механизм надо настроить и проверить; сам по себе Kubernetes безопасность не привозит. Для контуров КИИ (187-ФЗ) и персональных данных (152-ФЗ) решает дисциплина настройки, а не бренд платформы; порядок — в гайде «как организовать ИИ-безопасность в компании».
Путь эволюции
Правильная стратегия 2026 года — стартовать просто: один сервер, контейнеры, понятные скрипты. На Kubernetes переезжают по границам: сервисов стало больше десяти, команд — больше двух, появились круглосуточные пики и жёсткие SLA. Хорошая новость: контейнеризированные сервисы переезжают с compose на кластер почти без переписывания — цена отсроченного решения низкая, цена преждевременного высокая. Технические детали — «Kubernetes для LLM».
Вердикты по трём сценариям
Сценарий 1. Первый корпоративный контур
Простой сервер с docker-compose: контур от 690 000 ₽, сопровождение без редкой экспертизы, вся диагностика на одной машине. Kubernetes здесь — преждевременная оптимизация, отягощающая бюджет и команду.
Сценарий 2. Платформа с множеством ИИ-сервисов
Kubernetes: автоскейлинг, катления без простоя, изоляция команд. Заложите в бюджет инженера кластера — постоянную статью, а не разовую; иначе платформа деградирует быстрее, чем окупится.
Сценарий 3. Регулируемая среда, КИИ
Минимальная из возможных архитектур: простой сервер или небольшой кластер с жёсткой дисциплиной настройки — сегментация, журналы, шифрование. Локальный контур 0,9–1,2 млн ₽; каждый лишний компонент — лишний пункт проверки (187-ФЗ).
Типичные ошибки выбора
Ошибки инфраструктуры LLM-контура, за которые платят годами.
- Kubernetes на два сервиса: постоянная эксплуатация без единой выгоды.
- Простой сервер под двадцать микросервисов: ручной хаос обновлений.
- Кластер без инженера-владельца: деградация тихо, инцидент громко.
- Неконтейнеризированный старт: переезд на кластер превращается в переписывание.
- Сегментация и журналы спроектированы после выбора платформы, а не до.
Итог
Инфраструктура выбирается по трём фактам — сервисы, команда, SLA — а не по моде. Стартуйте просто, контейнеризируйте с первого дня и переезжайте на оркестрацию по факту роста, а не по его прогнозу. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Посчитайте сервисы и GPU: до десяти сервисов — скорее простой сервер.
- Ответьте честно: кто сопровождает инфраструктуру через год.
- Выпишите SLA: латентность, окна обновлений, допустимый простой.
- Сравните TCO с кластерной надбавкой и без неё на три года.
- Проверьте режим масштабирования: вертикаль и батч часто дешевле реплик.
- Зафиксируйте границы сегментации и журналы для 152-ФЗ/187-ФЗ.
- Заложите контейнеризацию с первого дня — переезд на кластер без переписывания.
Смежные материалы
Смежные сравнения: «монолит против микросервисов с LLM» и «Ollama или vLLM». Технологии: «Kubernetes для LLM» и «FastAPI-оркестрация». Услуги: «ИТ-поддержка-аутсорсинг». Вопросы: «сколько стоит сопровождение ИИ-системы».
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.