О компании: Разрабатываем ИИ-сервисы под задачи бизнеса

Словарь ИИ · определения

Что такое контекстное окно LLM?

Контекстное окно LLM — максимальный объём текста, который языковая модель одновременно удерживает при работе: системный промпт, историю диалога, подключённые документы и сам вопрос; всё, что не поместилось, модель уже не учитывает при ответе.

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

Окно измеряется в токенах — частях слов, которыми модель «видит» текст. Всё, что попадает в ответ, берётся только из окна: системный промпт, история диалога, подгруженные документы, результаты инструментов и текущий вопрос. Как только объём превышен, приложение обрезает старое — и бот «забывает» начало разговора.

Важно понимать: окно — это не «знания» модели, а её рабочая память на один запрос. Знания лежат в параметрах, полученных при обучении, а окно наполняется заново каждым обращением. Отсюда практическое следствие: увеличить «объём внимания» системы можно не только покупкой модели с большим окном, но и грамотной организацией того, что в это окно попадает, — фильтрацией, сжатием и точной подачей нужного.

Что входит в окно

  • Системный промпт: правила приложения, стиль, ограничения.
  • История диалога: накопленные сообщения пользователя и ответы.
  • Подгружаемый контент: фрагменты документов из RAG, результаты тулзов, содержимое страниц.
  • Текущий вопрос пользователя.

Пока суммарный объём этих частей укладывается в лимит, система работает штатно; превышение обычно наступает незаметно, в середине длинного рабочего диалога.

Почему окно «забивается»

Типичные пожиратели объёма — длинные PDF, которые загружают целиком «на всякий случай», накопленная история многочасового диалога и агентные прогоны, где каждый инструмент возвращает простыню текста. Отдельная ловушка — эффект «иглы в стоге сена»: даже внутри огромного окна факты из середины длинной подачи модель замечает хуже, чем из начала и конца.

Поэтому «загрузить всё» — антипаттерн: чем больше нерелевантного текста в окне, тем рассеяннее внимание модели и дороже каждый запрос. Грамотная альтернатива — подавать минимум необходимого: найденный фрагмент вместо целого документа, краткую сводку вместо полной истории. Это одновременно и качество, и экономика решения без покупки лишних лицензий.

Зачем бизнесу

  • Выбор модели под задачу: не платить за гигантское окно, если процессу хватает средней модели с грамотной подачей контекста.
  • Понимание сбоев: «бот забыл, о чём говорили» — это не каприз модели, а переполненное окно без суммаризации.
  • Проектирование RAG: вместо загрузки всей базы — поиск и подача только релевантных фрагментов; об этом же — наш разбор RAG в словаре.

Как работать с ограничением

Чанкинг и поиск вместо полной загрузки документов, суммаризация старой истории диалога, кэширование неизменной части промпта и очистка контекста между логическими сессиями. Сравнение моделей под документооборот — в материале как выбрать LLM для обработки документов.

Как не платить за лишнее окно

На практике стоимость владения растёт с размером окна: дороже инференс, больше памяти, выше требования к ускорителям. Поэтому зрелая архитектура начинается не с выбора «самой большой» модели, а с аудита процесса: сколько токенов реально нужно на запрос, как часто повторяется неизменяемая часть промпта (её выгодно кэшировать), какие документы можно не грузить вовсе. Нередко выясняется, что процессу хватает средней модели, а разница в цене железа уходит в другие задачи.

Цены «от» (сентябрь 2026)

Аудит процессов и данных — от 90 000 ₽ за 3–5 рабочих дней; пилот LLM+RAG с настройкой подачи контекста — от 480 000 ₽ за 4–6 недель; полный промышленный контур — 0,9–1,2 млн ₽. Цены сентября 2026, без НДС (УСН).

С чего начать

Замерьте реальный объём контекста вашего процесса: сколько токенов занимают типовые документы и история. Часто оказывается, что задача решается средней моделью с аккуратным поиском — без переплаты за максимальное окно и связанное с ним железо.

Частые вопросы

В русском тексте токен — это примерно 2–4 символа, слово в среднем занимает 2–3 токена. Поэтому даже «128 тысяч токенов» — это десятки страниц текста, а не библиотека.

История занимает окно целиком; при переполнении старые сообщения вытесняются, если приложение не делает суммаризацию диалога.

Нет: даже огромный контекст не заменяет поиск по актуальной базе — точность, свежесть данных и права доступа обеспечивает именно RAG-подача фрагментов.

Бесплатный разбор ТЗ

Пришлите ТЗ, описание процесса или ссылку на закупку — оценим объём, дадим смету «от…» и честно скажем, какой формат вам нужен: пилот или полный контракт.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.