Что считается GPU-кластером для LLM
Для задач ИИ «кластером» мы называем любое скоординированное множество GPU-ускорителей: от одного сервера на восемь ускорителей с высокоскоростной связностью до многонодной системы с выделенной сетью. Ключевое слово — скоординированное: ускорители работают над одной задачей (крупная модель не помещается в одно устройство и режется на части) или обслуживают общий пул нагрузки с общим планировщиком. Отдельный вопрос — назначение: инференс (обслуживание запросов) и дообучение предъявляют к кластеру разные требования по памяти, сети и утилизации.
Важно снять ложное ожидание: кластер — не универсальный «апгрейд скорости». Существенная доля корпоративных задач (модели 7–14 млрд параметров в квантованном виде, пилоты, внутренние ассистенты) решается одной GPU-машиной или даже CPU-инференсом — об этом отдельный материал про локальные LLM. Кластер оправдан, когда модель крупная, нагрузка измеряется сотнями параллельных запросов или предстоит регулярное дообучение.
Как считается память под модель
Базовая арифметика проста и надёжна: вес модели занимает примерно «число параметров × байт на вес». В 16-битной точности модель на 70 млрд параметров — это около 140 ГБ только весов; в 4-битном квантовании — около 35 ГБ. Поверх весов добавляется KV-кэш контекста (растёт с длиной контекста и числом параллельных запросов), активации и накладные расходы движка — на практике закладывается запас. Отсюда два практических рычага: квантование сокращает веса в разы, а батчинг повышает полезную нагрузку с того же объёма памяти.
- Инференс: память = веса + KV-кэш под целевое число одновременных запросов; выручает страничная организация кэша в движках типа vLLM.
- Дообучение: поверх весов — градиенты, оптимизаторные состояния и активации; требования к памяти в разы выше инференса, отсюда приёмы ZeRO-шардирования и offload.
- Правило номер один: считать под целевую модель и профиль нагрузки, а не «купить побольше» — иначе получается дорогой недогруженный парк.
Сеть: NVLink, InfiniBand, RDMA
Внутри сервера ускорители связываются высокоскоростными каналами (NVLink), между серверами — InfiniBand или RoCE поверх Ethernet с удалённым доступом к памяти (RDMA). Для многонодного инференса и обучения критична связность всех со всеми: коллективные операции (all-reduce при обучении, обмен частями при тензорном параллелизме) идут через открытую библиотеку NCCL от NVIDIA, и слабая сеть мгновенно превращает мощные GPU в простаивающие. Практическое правило: до определённого размера модели и нагрузки выгоднее «толстые» одноузловые серверы (8 ускорителей с NVLink), чем многонодная топология с дорогой сетью — границу определяет расчёт, а не мода на «кластеры».
Как применяем: планирование контура
- Профилирование нагрузки. Целевые модели, пиковое число запросов, длина контекстов, SLA по латентности, планы дообучения. Без профиля любое sizing-решение — угадывание.
- Выбор моделей и точности. Матрица «модель × формат весов» под задачи; где-то хватит 8-битной версии, где-то нужна полная точность.
- Сizing и топология. Расчёт памяти, выбор «один толстый узел vs несколько», спецификация сети и хранения (веса, датасеты, чекпоинты).
- Движок и параллелизм. vLLM или TensorRT-LLM; тензорный параллелизм внутри узла, конвейерный — между узлами.
- Планирование и изоляция. Пул встраивается в Kubernetes: квоты, автоскейлинг инференса, MIG-разбиение ускорителей на изолированные слайсы для мелких сервисов.
- Нагрузочные испытания. Прогон профиля на собранном контуре, фиксация латентности и пропускной способности, настройка батчинга — до приёмки.
Текстовая схема: запросы → балансировщик → движок инференса (батчинг, KV-кэш) → пул GPU (NVLink внутри узла, InfiniBand/RoCE между) → планировщик (Kubernetes, квоты, MIG) → мониторинг утилизации и латентности.
| Формат | Цена | Срок |
|---|---|---|
| Аудит нагрузки и расчёт конфигурации (sizing) | от 90 000 ₽ | 1–2 недели |
| Пилот: сборка контура, движок, нагрузочные испытания | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: пул, планировщик, MIG, регламенты | от 690 000 ₽ | 4–6 недель |
| Многоплощадковый кластер с дообучением и мониторингом | 0,9–1,2 млн ₽ | 8–10 недель |
MIG и изоляция арендаторов
Когда через пул работают несколько команд, встаёт вопрос изоляции: «тяжёлый» эксперимент одной команды не должен обрушить продакшн-инференс другой. Программное разбиение MIG (Multi-Instance GPU) — документированная возможность платформы NVIDIA — делит один физический ускоритель на несколько изолированных инстансов со своей памятью и вычислениями. Это удобно для мелких сервисов и тестовых окружений; для крупных моделей MIG не применяется — они требуют целого устройства или нескольких. Поверх MIG работают квоты и приоритеты планировщика: продакшн-очередь важнее исследовательской.
Инференс и дообучение — разные кластеры
Частая ошибка — проектировать «один кластер на всё». Требования конфликтуют: инференсу важна латентность и равномерная загрузка, дообучению — пиковые захваты всего пула на часы, большой объем памяти и быстрое хранение чекпоинтов. Рабочие варианты: раздельные пулы с общим планировщиком, либо единый пул с приоритетным вытеснением тренировочных задач продакшн-нагрузкой. Решение фиксируется после профилирования — универсального ответа нет, и мы его не изобретаем: выбор делается по цифрам вашей нагрузки.
Российский контекст и стоимость владения
Два практических вопроса от заказчиков: доступность оборудования и привязка к экосистеме. Экосистема NVIDIA (CUDA, NCCL, оптимизированные движки) — фактически отраслевой стандарт, но это и зависимость от одного вендора; российские ускорители и перспективы локального инференса разобраны в нашем обзоре про российские GPU и инференс к 2027 году. Полная стоимость владения — не только цены ускорителей: питание, охлаждение, обслуживание, недогруз — структура TCO разобрана в материале TCO собственного LLM; нередко аренда GPU на переходный период выгоднее покупки.
Тонкости, которые всплывают в проектах
Питание и тепло: узел на восемь ускорителей — это десятки киловатт под нагрузкой; стойка и кондиционирование проектируются заранее. Версионный коктейль: драйверы, CUDA, движок инференса и сборка движка под конкретную модель должны быть согласованы — обновление одного звена ломает другое, поэтому матрица версий фиксируется документом и меняется регламентно. Деградация сети: деградировавшие порты InfiniBand/RoCE дают «загадочные» падения производительности — нужны метрики по каждому каналу. И мониторинг утилизации: простой дорогого GPU — самый дорогой вид простоя; пороговые алерты и права на перераспределение мощности прописываются в регламенте эксплуатации.
Хранение: веса, датасеты, чекпоинты
Кластер — это не только ускорители: вокруг него живёт слой хранения. Веса моделей (десятки и сотни гигабайт на версию) раздаются узлам быстро — с локального NVMe или ближнего хранилища, а не по медленному каналу; иначе каждый рестарт сервиса превращается в ожидание. Датасеты и корпус знаний для RAG лежат рядом с инференсом, а чекпоинты дообучения — на отдельном защищённом томе с политикой ротации и репликации: потеря чекпоинта длинного обучения — самая обидная и при этом самая предотвратимая авария.
Отдельно проектируется реестр образов: контейнер движка инференса с зафиксированными версиями библиотек раздаётся узлам из внутреннего registry — это часть регламента воспроизводимости. Матрица «модель × формат весов × версия движка × версия драйвера» документируется: именно она отвечает на вопрос эксплуатации «что и с чем совместимо» без археологии по чатам команды.
Как стартуем
- Пришлите список целевых задач и моделей (или описание сценариев) — соберём профиль нагрузки и sizing-расчёт за 1–2 недели.
- Пилот: разворачивание движка на вашем или арендованном железе, нагрузочные испытания, отчёт с латентностью и пропускной способностью — от 480 000 ₽.
- Решение о покупке или аренде — по расчёту TCO на ваших цифрах, а не по каталогу вендора.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.