Как работает промпт-кэширование
Большая часть корпоративного запроса к модели статична: системная инструкция, регламенты, документы базы знаний, история диалога — всё это кочует из запроса в запрос почти без изменений. Пересчитывать эти килотокены заново каждый раз расточительно. Промпт-кэширование запоминает результат их обработки и переиспользует: полная цена — один раз, дальше кэшированная часть идёт по сниженному тарифу.
- Префикс. Кэшируется начало запроса — всё, что стоит до переменной части. Это свойство механики: совпадение проверяется с первого токена и до первого расхождения.
- Запись кэша. При первом обращении обработанный префикс сохраняется на сервере провайдера или инференс-движка с ограниченным временем жизни.
- Попадание. Следующий запрос с тем же началом использует сохранённую обработку: время до первого токена сокращается, кэшированные токены тарифицируются со скидкой.
- Истечение. Кэш живёт от минут до часов-дней в зависимости от провайдера; «холодный» запрос после истечения снова оплачивается полностью.
Что даёт кэш в разных сценариях
| Сценарий | Стабильная часть запроса | Эффект кэша |
|---|---|---|
| Корпоративный ассистент | Системный промпт с регламентами | Скидка на префикс в каждом обращении |
| RAG по базе знаний | Инструкция + типовые документы | Быстрее ответы, дешевле длинный контекст |
| Многошаговый диалог | История предыдущих реплик | Каждый ход не перечитывает всё заново |
| Агент с инструментами | Определения функций и правила | Дешевле каждый шаг цикла |
| Разовые задачи | Нет повторяющегося префикса | Кэш не работает |
Правило проектирования вытекает из механики: длинное и стабильное — в начало промпта, короткое и переменное — в конец. Порядок блоков в промпте при включённом кэше становится экономическим решением, а не только стилистическим.
Где промпт-кэширование встречается в бизнес-задачах
- Ассистенты с объёмной инструкцией. Десятки страниц регламентов в системном промпте: без кэша каждый чат оплачивал бы их обработку целиком, с кэшем — только первый запрос и продления жизни кэша.
- Диалоговая поддержка. Длинные сессии с клиентами: каждый следующий ход опирается на кэшированную историю, а не считает её заново — заметная экономия на высоконагруженных линиях.
- Пакетная обработка с общим шаблоном. Тысячи однотипных задач с одинаковой шапкой-инструкцией: кэш размазывает стоимость префикса на весь батч.
- Агентные сценарии. Многошаговые циклы, где определения инструментов и правила повторяются на каждом шаге — кэш делает каждого ИИ-агента дешевле в работе.
Ограничения и тонкости
Хрупкость совпадения. Изменилась одна буква в начале промпта, переставлены местами блоки, другая версия документа — префикс не совпал, кэш промахнулся. Промпты версионируют и меняют осознанно. Время жизни. Кэш истекает; при редком трафике между обращениями попадания не будет, и выгода исчезает — поэтому эффект считают именно на своём графике нагрузки. Порог минимальной длины. Провайдеры кэшируют префикс от определённого числа токенов: короткие промпты не попадают под механизм вовсе. Изоляция данных. Для чувствительных сценариев уточняют у провайдера, как кэш изолирован между клиентами; строгий вариант — локальный инференс со своим кэшированием в контуре компании и режимом 152-ФЗ.
Сколько стоит (сентябрь 2026)
Включение и настройка кэширования в существующем ассистенте (порядок блоков, версионирование промптов, замер экономики) — от 90 000 ₽; пилот с кэш-стратегией для RAG-контура и диалоговых сессий — от 480 000 ₽; промышленная схема с мониторингом попаданий и управлением жизнью кэша на своих инференс-узлах — от 690 000 ₽. Интеграция с API российских провайдеров — GigaChat API и YandexGPT API.
Как начать
Разложите текущий промпт ассистента на стабильное и переменное, поставьте стабильное в начало и включите кэш у провайдера — затем сравните счёт за токены и время до первого токена за неделю до и после. Обычно этого достаточно, чтобы увидеть эффект на длинных инструкциях. Системное встраивание кэш-стратегии — LLM-интеграции; связанная метрика — латентность инференса.