Зачем запускать LLM без видеокарт
Графические ускорители — главный дефицит ИИ-инфраструктуры: их сложно закупить, дорого обслуживать, а для части задач они избыточны. CPU-инференс закрывает нишу: внутренний ассистент для офиса, обработка документов раз в час, ассистент на борту оборудования, прототип до выделения бюджета на GPU. Уже существующие серверы без видеокарт становятся рабочим стендом. Отдельный класс сценариев — регулируемые среды, где видеокарты просто нет и не будет: изолированные АРМ, закрытые сегменты, бортовые системы. Там CPU-инференс не компромисс, а единственный вариант.
Физика процесса проста: современные модели можно «сжать» квантованием — заменить точные веса на более грубые и получить файл в разы меньше исходного. Квантованные компактные модели (обычно до 8B, в удачных случаях до 14B–32B) помещаются в оперативную память сервера и отвечают с приемлемой скоростью, когда запросов немного. Про форматы квантования — наша страница квантование GGUF и AWQ.
Честная граница пути: CPU не заменит GPU при потоковой нагрузке. Десятки одновременных пользователей, длинные контексты, большие MoE-модели — это территория ускорителей (Ollama или vLLM, сервинг под нагрузкой). CPU-инференс — осознанный компромисс, а не «бесплатный GPU».
Проверенные факты: инструменты стека
| Инструмент | Разработчик | Лицензия и назначение |
|---|---|---|
| llama.cpp | сообщество ggml-org | MIT; инференс LLM на CPU (и GPU), популяризовал формат GGUF; работа с квантованными моделями |
| ONNX Runtime | Microsoft | MIT; рантайм для моделей в формате ONNX: серверы, встраиваемые сценарии, работа с разными бэкендами |
| LiteRT | Apache 2.0; среда выполнения ML на устройствах (преемник TensorFlow Lite) — мобильные и edge-сценарии | |
| GGUF | сообщество llama.cpp | формат файлов квантованных моделей — фактически стандарт обмена для локального инференса |
Сверка — по официальным репозиториям и документации проектов, 20 сентября 2026 года. Все три инструмента пермиссивны по лицензиям и допустимы в коммерческих продуктах; обязателен лишь стандартный атрибутив — сохранение уведомлений лицензий.
Варианты развёртывания
Сервер без GPU
Типовой контур: квантованная модель в GGUF под llama.cpp на обычном сервере с достаточной оперативной памятью; компактные модели из каталогов Qwen, Llama или дистилляты DeepSeek. Для экспериментов и демо удобна Ollama; для промышленного API поверх llama.cpp мы собираем сервисный слой с авторизацией и логами.
Edge и мобильные устройства
LiteRT — путь для Android-приложений и встраиваемых платформ: модель конвертируется и выполняется на устройстве без сервера. ONNX Runtime покрывает смешанные сценарии — от серверов до периферии — единым форматом. Голосовые команды на устройстве, офлайн-помощник в поле, предварительная фильтрация данных до отправки в контур — рабочие примеры.
Гибрид
Прагматичная схема многих проектов: компактная модель на CPU для 80% типовых запросов + большая модель на GPU (или облачный API) для сложных. Маршрутизация по сложности запроса — LLM-роутинг.
Как НЬЮ-ССТ внедряет CPU-инференс
Лестница проектов: аудит задач и имеющегося железа (от 90 000 ₽) → пилот на вашем оборудовании с замерами скорости и качества (от 480 000 ₽) → MVP с интеграцией в процессы (от 690 000 ₽) → промышленная система с мониторингом (0,9–1,2 млн ₽). Ключевой этап — измерение: сколько токенов в секунду даёт ваш сервер на целевой модели, сколько держит одновременных пользователей, где порог перехода на GPU.
Мы начинаем с задач, а не с технологий: если у процесса 200 запросов в день, CPU-контур закроет его целиком; если 200 в минуту — нужен другой разговор. Сравнение стратегий: облачный LLM или on-premise, SLM против LLM; общий фреймворк — LLM-интеграции.
Практический пример маршрута
Рамка CPU-проекта: региональный офис без GPU-сервера получает внутреннего ассистента по регламентам на квантованной модели 7B–8B под llama.cpp; пиковая нагрузка — десяток сотрудников одновременно. Замеры пилота фиксируют скорость генерации и качество ответов на корпусе регламентов; параллельно готовится план роста — при каком трафике контур переезжает на GPU или гибрид с роутингом. Обновление модели — контролируемое, с проверкой контрольных сумм и повторением тестов. Так офис получает работающий ИИ уже на существующем железе, а решение о капитальных вложениях принимается по данным, а не по гипотезе.
Частые ошибки CPU-инференса
- Ожидание GPU-скорости. CPU-инференс — компромисс: один-два пользователя терпимы, потоковая нагрузка — нет. Считайте пиковую нагрузку, а не среднюю.
- Модель без запаса по памяти. Кроме весов нужна память под контекст и системные процессы; впритык — это нестабильность на длинных запросах.
- Квантование без повторных тестов. Поведение квантованной модели на граничных задачах может отличаться; приёмочные тесты повторяются после конвертации.
- Edge-сценарии без офлайн-обновлений. Устройства в поле должны получать версии модели контролируемо, с проверкой целостности.
- Нет плана роста. Проект, рассчитанный только на CPU, должен знать порог перехода на GPU — иначе рост нагрузки станет аварией.
Правильно спроектированный CPU-контур — рабочее решение; неправильно — источник разочарования в ИИ. Разница — в замерах.
Безопасность и риски
Локальный инференс радикально снижает риск утечки данных через внешние API — данные не покидают периметр. Но остальные угрозы остаются: OWASP LLM Top-10 применим к любой модели; квантование может слегка менять поведение модели на граничных запросах — после конвертации мы повторяем приёмочные тесты.
Отдельный блок — целостность цепочки поставки: веса скачиваются из публичных репозиториев, поэтому фиксируются контрольные суммы, версия и источник каждой модели; актив вносится в AI BOM. Модели больше 1 млрд параметров — большие фундаментальные модели со всеми правилами эксплуатации по закону об ИИ, независимо от того, на чём они работают — на GPU или CPU.