Вопрос встаёт, когда решение о своей модели уже принято: локальный контур, приватность данных или предсказуемая стоимость на большом трафике. Осталось выбрать — арендовать GPU в облаке или купить сервер в собственную серверную. Это классическая развилка CAPEX против OPEX, но с ИИ-спецификой: поколения ускорителей меняются быстро, а утилизация железа — редкая и рваная на старте.
Страница сводит выбор в таблицы «когда что» и критериев: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Общий выбор «облако против своей инфраструктуры» разобран в гиде «облачный LLM или on-premise»; здесь — конкретно экономика железа под инференс.
Кратко: когда что выбирать
Прямой ответ — в таблице: слева ситуация, справа разумное решение по состоянию на сентябрь 2026 года. Если узнали свою компанию в одной из строк — дальше достаточно проверить решение по чек-листу в конце страницы, а не перечитывать весь интернет.
| Ситуация | Решение | Почему |
|---|---|---|
| Пилот и первые месяцы эксплуатации | аренда GPU | нагрузка неизвестна: платить за простой своего железа рано |
| Круглосуточная загрузка выше 60–70% месяцами | свой сервер | окупаемость укладывается в 12–24 месяца, дальше — экономия |
| Рваная нагрузка: пики кампаний, сезонность | аренда с автомасштабированием | эластичность дешевле, чем пиковой запас своего парка |
| Данные не должны покидать контур компании | свой сервер в своём ЦОД | аренда у облачного провайдера — это чужая площадка и договор |
| Нет ИТ-команды для эксплуатации железа | аренда | обслуживание, замена и мониторинг — на стороне провайдера |
| Тендер с требованием собственного оборудования | свой сервер | закупка железа — часть проектной документации |
Критерии сравнения
Развёрнутая матрица по критериям, которые заказчики проверяют перед решением: стоимость, сроки, риски, поддержка, комплаенс и режим данных. Каждая строка матрицы ниже раскрыта отдельным разбором — с пояснениями, откуда берутся цифры и на что смотреть в вашей ситуации.
| Критерий | Аренда GPU | Свой сервер |
|---|---|---|
| Тип затрат | OPEX: помесячно, растёт с нагрузкой | CAPEX: разовая закупка плюс амортизация |
| Стоимость старта | пилот контура — от 480 000 ₽ без закупок | контур со своим железом — от 690 000 ₽ с сервером |
| Сроки запуска | часы: инстанс поднимается по запросу | недели: закупка, поставка, монтаж, настройка |
| Масштабирование | вверх и вниз за минуты | вверх — только новой закупкой |
| Риски | изменение тарифов провайдера, лимиты квот | деградация и поломки на вашей ответственности, устаревание поколения |
| Поддержка | железо обслуживает провайдер по SLA | ваша команда или сервисный контракт с запчастями |
| Режим данных | физическое размещение у провайдера, договор поручения | полностью свой контур: размещение и доступы контролируете вы |
Матрица выше — навигация: ключевая строка — тип затрат; разбор ниже превращает её в расчёт окупаемости.
Разбор критериев
Экономика: утилизация решает всё
Единственная метрика, которая честно отвечает на вопрос «аренда или покупка», — утилизация: какой процент времени железо реально считает. Арендованный GPU при круглосуточной загрузке стоит заметно больше, чем владение аналогичным сервером на горизонте года-двух; простаивающий собственный сервер — наоборот, дороже аренды, к которой вы не прибегали. Порог принятия решения на практике — устойчивые 60–70% загрузки. Как считать полную стоимость владения, разбирает гайд «TCO ИИ-решения»; почему свой контур в итоге выгоднее облака при больших объёмах — ответ на вопрос «почему on-premise дороже облака, но выгоднее».
Скорость запуска и эластичность
Аренда выигрывает на старте всегда: инстанс поднимается за часы, а не недели, и его же можно выключить на выходные пилота. Для проекта, который ещё не знает своей нагрузки, это не удобство, а способ не угадать с закупкой. Свой сервер — решение для известной нагрузки: когда профиль трафика стабилен, предсказуем и подтверждён месяцами эксплуатации на арендованном железе.
Риски и устаревание поколения
У аренды риск экономический: тарифы меняются, квоты ограничивают, популярные конфигурации бывают заняты в час пик. У своего сервера риск технический и временной: поломка блокирует контур до замены, а поколение ускорителей устаревает — через два-три года закупленное железо уступит новому в соотношении цена-производительность. Страховка в обоих случаях одна: резервный канал, например облачный API на время ремонта.
Сопровождение и команда
Свой сервер — это ещё и люди: мониторинг температур и износа, замена дисков и вентиляторов, обновления драйверов, резервное копирование. Аренда снимает это с команды целиком. Если ИТ-подразделение маленькое, честный ответ почти всегда «аренда, пока не вырастете»; критерии готовности команды к своей инфраструктуре стоит проверить до закупки, а не после.
Комплаенс и режим данных
Для части сценариев вопрос экономики вообще не главный: кадровые данные, медицинские записи или секретные документы могут требовать физического размещения в собственном контуре. Свой сервер в своём ЦОД даёт максимальный контроль; аренда GPU допускается там, где договор поручения обработки и расположение площадки закрывают требования 152-ФЗ. Локальный контур под чувствительные данные — от 690 000 ₽; подходы к размещению — в услуге «локальная LLM в контуре».
Промежуточные варианты
Между «чистой арендой» и «своим ЦОД» есть гибриды: выделенный сервер у хостера (аренда без мультиарендности, но без закупки), резервирование арендованного железа под пики при базовой нагрузке на своём парке, и связка «своё железо для базовой нагрузки + облачный API как страховка на ремонт». Для большинства компаний 2026 года оптимум — именно такая схема, а не чистый полюс.
Вердикты по трём сценариям
Сценарий 1. Пилот и первый год эксплуатации
Аренда: без закупок, с железом актуальной генерации и возможностью остановиться без списания активов. Пилот локального контура на арендованных GPU — от 480 000 ₽. Решение о закупке принимается по фактической утилизации, измеренной за месяцы, а не по прогнозу.
Сценарий 2. Стабильная высокая нагрузка
Свой сервер: при загрузке выше 60–70% круглосуточно владение дешевле аренды на горизонте 12–24 месяцев — это модельный пример окупаемости, точный срок зависит от конфигурации и тарифов. Промышленный контур со своим железом — от 690 000 ₽, полный договор с инфраструктурой — 0,9–1,2 млн ₽. Обязателен резервный канал на время поломок.
Сценарий 3. Чувствительные данные и переменная нагрузка
Свой сервер в своём или доверенном ЦОД под чувствительные классы данных, плюс аренда под пики некритичной нагрузки. Разделение по классам данных снимает конфликт между требованиями безопасности и экономикой. Оркестрация такого смешанного контура — в гиде «Kubernetes или простой сервер для LLM».
Типичные ошибки выбора
Ошибки этого выбора — самые дорогие в ИИ-инфраструктуре: закупленное железо не вернуть по цене покупки.
- Закупка сервера до пилота: нагрузка не подтверждена, утилизация угадана.
- Расчёт окупаемости по пиковой нагрузке вместо среднесуточной.
- Игнорирование сопровождения: сервер требует команды, запчастей и мониторинга.
- Отсутствие резервного канала: поломка своего железа останавливает сервис.
- Закупка впритык к текущей модели — без запаса под следующие поколения.
Итог
Аренда — пока нагрузка неизвестна или рваная; свой сервер — при подтверждённой круглосуточной загрузке выше 60–70% или требованиях к физическому контуру; оптимум зрелых компаний — гибрид с резервированием. Решение стоит перепроверить на своих цифрах: разбор задачи бесплатный, ответ — за 1 рабочий день.
Чек-лист решения
Семь пунктов, которые стоит закрыть до выбора: они одинаково полезны обоим вариантам и закрывают большинство ошибок из списка выше. Пройдите список с командой — обычно это один рабочий час, который экономит недели переделок.
- Измерьте или спрогнозируйте среднесуточную утилизацию GPU на месяц вперёд.
- Сравните стоимость владения сервером и аренды на горизонтах 12 и 24 месяца.
- Выпишите классы данных: каким разрешено обработку на арендованном железе.
- Проверьте команду: кто обслуживает железо, дежурит и меняет компоненты.
- Заложите резервный канал на случай поломки или нехватки квот.
- Проверьте требования закупки: для тендера может быть обязательна собственная инфраструктура.
- Зафиксируйте решение и цифры — к следующей закупке они станут базой сравнения.
Смежные материалы
Общая развилка размещения — «облачный LLM или on-premise»; оркестрация — «Kubernetes или простой сервер для LLM»; экономия железа — «квантованная или полная модель»; практика — GPU-кластеры для LLM и квантование GGUF/AWQ.
Полный каталог разборов «или — или» — в разделе Сравнения; форматы работ, сроки и цены «от» — в каталоге услуг.