Что такое vLLM
vLLM — открытый движок подачи языковых моделей, ставший индустриальным стандартом для тех, кто держит модели на собственных GPU. Две его известные технологии — PagedAttention, организация памяти инференса постранично, и continuous batching, непрерывная обработка потока запросов, — вместе дают высокую утилизацию ускорителей без деградации времени ответа. Сервер говорит на OpenAI-совместимом протоколе, поэтому приложения не замечают подмены бэкенда.
Задачи, которые решает заказчику
- Много пользователей: сотни одновременных запросов от ассистентов и чат-ботов компании на одном GPU-узле.
- Экономия железа: корректная упаковка батчей снимает необходимость «по GPU на каждый сервис».
- Закрытый контур: тексты обращений, договоров и писем не уходят к внешним операторам моделей.
- Замена зависимости: переход с зарубежного API на собственный сервер без переписывания приложений.
Этапы внедрения и цены
| Формат | Цена | Срок |
|---|---|---|
| Аудит нагрузки и расчёт GPU-конфигурации | от 90 000 ₽ | 3–5 рабочих дней |
| Пилот: vLLM + модель + RAG на ваших данных | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: реплики, мониторинг, обновления | 0,9–1,2 млн ₽ | 4–6 недель |
| Сопровождение инференс-контура | от 50 000 ₽/мес | ежемесячно |
При расчёте бюджета важно считать не только покупку GPU: электричество, охлаждение и персонал образуют полную стоимость владения — методику собрали в материале «TCO собственного LLM». Вопрос доступности ускорителей в России — в обзоре российских GPU и инференса.
Тонкости, которые всплывают в проектах
Первая — выбор квантования модели: чем сильнее сжатие, тем больше запросов на том же железе, но тем внимательнее нужна проверка качества на ваших данных; проводим её на прототипе. Вторая — размер контекстного окна: длинные договоры и протоколы съедают память, и это надо учитывать в конфигурации. Третья — обновление моделей: контейнеризуем и тестируем новые версии на стенде, а не в бою. Общая логика перевода моделей в свой контур — в гиде «Как перевести LLM в локальный контур».
Как стартуем
- Вы присылаете описание сценариев и ожидаемый поток запросов — мы считаем, какая GPU-конфигурация их выдержит.
- Разворачиваем пилот на стенде и прогоняем нагрузочный тест с вашими документами.
- По результатам фиксируем архитектуру, SLA и смету промышленного контура.