Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Каталог ИИ-моделей · инференс-стек · сентябрь 2026

Инференс LLM без GPU: llama.cpp, ONNX Runtime и LiteRT — каталог стека

Не каждому проекту нужен GPU-кластер: компактные модели на CPU решают десятки прикладных задач. На странице — проверяемые факты о трёх инструментах CPU/edge-инференса и честные границы этого пути.

Коротко · проверяемые факты · 2026-09-20

CPU-инференс выбирают для компактных моделей (примерно до 8–14B в квантованном виде), редких нагрузок, edge-устройств и изолированных контуров без видеокарт. Базовые инструменты — llama.cpp (MIT, GGUF), ONNX Runtime (MIT) и LiteRT от Google (Apache 2.0, бывший TensorFlow Lite) для мобильных и встраиваемых сценариев.

CPU-пилот LLM на вашем железе — от 480 000 ₽, аудит — от 90 000 ₽ аудит процесса — от 90 000 ₽ · пилот — от 480 000 ₽ · MVP — от 690 000 ₽

Зачем запускать LLM без видеокарт

Графические ускорители — главный дефицит ИИ-инфраструктуры: их сложно закупить, дорого обслуживать, а для части задач они избыточны. CPU-инференс закрывает нишу: внутренний ассистент для офиса, обработка документов раз в час, ассистент на борту оборудования, прототип до выделения бюджета на GPU. Уже существующие серверы без видеокарт становятся рабочим стендом. Отдельный класс сценариев — регулируемые среды, где видеокарты просто нет и не будет: изолированные АРМ, закрытые сегменты, бортовые системы. Там CPU-инференс не компромисс, а единственный вариант.

Физика процесса проста: современные модели можно «сжать» квантованием — заменить точные веса на более грубые и получить файл в разы меньше исходного. Квантованные компактные модели (обычно до 8B, в удачных случаях до 14B–32B) помещаются в оперативную память сервера и отвечают с приемлемой скоростью, когда запросов немного. Про форматы квантования — наша страница квантование GGUF и AWQ.

Честная граница пути: CPU не заменит GPU при потоковой нагрузке. Десятки одновременных пользователей, длинные контексты, большие MoE-модели — это территория ускорителей (Ollama или vLLM, сервинг под нагрузкой). CPU-инференс — осознанный компромисс, а не «бесплатный GPU».

Проверенные факты: инструменты стека

ИнструментРазработчикЛицензия и назначение
llama.cppсообщество ggml-orgMIT; инференс LLM на CPU (и GPU), популяризовал формат GGUF; работа с квантованными моделями
ONNX RuntimeMicrosoftMIT; рантайм для моделей в формате ONNX: серверы, встраиваемые сценарии, работа с разными бэкендами
LiteRTGoogleApache 2.0; среда выполнения ML на устройствах (преемник TensorFlow Lite) — мобильные и edge-сценарии
GGUFсообщество llama.cppформат файлов квантованных моделей — фактически стандарт обмена для локального инференса

Сверка — по официальным репозиториям и документации проектов, 20 сентября 2026 года. Все три инструмента пермиссивны по лицензиям и допустимы в коммерческих продуктах; обязателен лишь стандартный атрибутив — сохранение уведомлений лицензий.

Варианты развёртывания

Сервер без GPU

Типовой контур: квантованная модель в GGUF под llama.cpp на обычном сервере с достаточной оперативной памятью; компактные модели из каталогов Qwen, Llama или дистилляты DeepSeek. Для экспериментов и демо удобна Ollama; для промышленного API поверх llama.cpp мы собираем сервисный слой с авторизацией и логами.

Edge и мобильные устройства

LiteRT — путь для Android-приложений и встраиваемых платформ: модель конвертируется и выполняется на устройстве без сервера. ONNX Runtime покрывает смешанные сценарии — от серверов до периферии — единым форматом. Голосовые команды на устройстве, офлайн-помощник в поле, предварительная фильтрация данных до отправки в контур — рабочие примеры.

Гибрид

Прагматичная схема многих проектов: компактная модель на CPU для 80% типовых запросов + большая модель на GPU (или облачный API) для сложных. Маршрутизация по сложности запроса — LLM-роутинг.

Как НЬЮ-ССТ внедряет CPU-инференс

Лестница проектов: аудит задач и имеющегося железа (от 90 000 ₽) → пилот на вашем оборудовании с замерами скорости и качества (от 480 000 ₽) → MVP с интеграцией в процессы (от 690 000 ₽) → промышленная система с мониторингом (0,9–1,2 млн ₽). Ключевой этап — измерение: сколько токенов в секунду даёт ваш сервер на целевой модели, сколько держит одновременных пользователей, где порог перехода на GPU.

Мы начинаем с задач, а не с технологий: если у процесса 200 запросов в день, CPU-контур закроет его целиком; если 200 в минуту — нужен другой разговор. Сравнение стратегий: облачный LLM или on-premise, SLM против LLM; общий фреймворк — LLM-интеграции.

Практический пример маршрута

Рамка CPU-проекта: региональный офис без GPU-сервера получает внутреннего ассистента по регламентам на квантованной модели 7B–8B под llama.cpp; пиковая нагрузка — десяток сотрудников одновременно. Замеры пилота фиксируют скорость генерации и качество ответов на корпусе регламентов; параллельно готовится план роста — при каком трафике контур переезжает на GPU или гибрид с роутингом. Обновление модели — контролируемое, с проверкой контрольных сумм и повторением тестов. Так офис получает работающий ИИ уже на существующем железе, а решение о капитальных вложениях принимается по данным, а не по гипотезе.

Частые ошибки CPU-инференса

  • Ожидание GPU-скорости. CPU-инференс — компромисс: один-два пользователя терпимы, потоковая нагрузка — нет. Считайте пиковую нагрузку, а не среднюю.
  • Модель без запаса по памяти. Кроме весов нужна память под контекст и системные процессы; впритык — это нестабильность на длинных запросах.
  • Квантование без повторных тестов. Поведение квантованной модели на граничных задачах может отличаться; приёмочные тесты повторяются после конвертации.
  • Edge-сценарии без офлайн-обновлений. Устройства в поле должны получать версии модели контролируемо, с проверкой целостности.
  • Нет плана роста. Проект, рассчитанный только на CPU, должен знать порог перехода на GPU — иначе рост нагрузки станет аварией.

Правильно спроектированный CPU-контур — рабочее решение; неправильно — источник разочарования в ИИ. Разница — в замерах.

Безопасность и риски

Локальный инференс радикально снижает риск утечки данных через внешние API — данные не покидают периметр. Но остальные угрозы остаются: OWASP LLM Top-10 применим к любой модели; квантование может слегка менять поведение модели на граничных запросах — после конвертации мы повторяем приёмочные тесты.

Отдельный блок — целостность цепочки поставки: веса скачиваются из публичных репозиториев, поэтому фиксируются контрольные суммы, версия и источник каждой модели; актив вносится в AI BOM. Модели больше 1 млрд параметров — большие фундаментальные модели со всеми правилами эксплуатации по закону об ИИ, независимо от того, на чём они работают — на GPU или CPU.

Смотрите также

Частые вопросы: инференс без GPU

Рабочая зона — компактные плотные модели примерно до 8B, а при хорошем сервере и неторопливых запросах — до 14B и выше в квантованном виде (GGUF). MoE-модели с малым числом активных параметров тоже могут работать. Всё, что больше, и потоковая нагрузка — территория GPU.

llama.cpp — проект сообщества ggml-org под лицензией MIT, созданный для запуска LLM локально и породивший формат GGUF. ONNX Runtime (Microsoft, MIT) — универсальный рантайм для моделей в формате ONNX на серверах и периферии. LiteRT (Google, Apache 2.0) — среда выполнения ML на мобильных и edge-устройствах, преемник TensorFlow Lite.

Разница измеряется в разах и зависит от модели, квантования и нагрузки: единичные запросы терпимы, десятки одновременных пользователей — нет. Ответ даётся замером на вашем железе: пилот фиксирует скорость генерации и число параллельных сессий, после чего видно, хватает ли CPU или нужен GPU.

Лёгкое квантование обычно почти не влияет на типовые задачи, но на граничных запросах и узкой терминологии эффект возможен. Поэтому после конвертации модели мы повторяем приёмочные тесты на вашем корпусе и сравниваем с исходной версией — это часть пилота, а не надежда на лучшее.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Разбор вашей задачи — бесплатно, за 1 рабочий день

Пришлите описание задачи — вернёмся с вилкой стоимости, сроками и рисками. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Факты о моделях — по официальным источникам разработчиков (сайты, Hugging Face, документация), проверено 2026-09-20; наши цены — «от», без НДС (УСН). ООО «НЬЮ-ССТ» (ИНН 7733311994) работает с 28.12.2016. Полный каталог направления — ИИ-разработка и защита информации.