Окно измеряется в токенах — частях слов, которыми модель «видит» текст. Всё, что попадает в ответ, берётся только из окна: системный промпт, история диалога, подгруженные документы, результаты инструментов и текущий вопрос. Как только объём превышен, приложение обрезает старое — и бот «забывает» начало разговора.
Важно понимать: окно — это не «знания» модели, а её рабочая память на один запрос. Знания лежат в параметрах, полученных при обучении, а окно наполняется заново каждым обращением. Отсюда практическое следствие: увеличить «объём внимания» системы можно не только покупкой модели с большим окном, но и грамотной организацией того, что в это окно попадает, — фильтрацией, сжатием и точной подачей нужного.
Что входит в окно
- Системный промпт: правила приложения, стиль, ограничения.
- История диалога: накопленные сообщения пользователя и ответы.
- Подгружаемый контент: фрагменты документов из RAG, результаты тулзов, содержимое страниц.
- Текущий вопрос пользователя.
Пока суммарный объём этих частей укладывается в лимит, система работает штатно; превышение обычно наступает незаметно, в середине длинного рабочего диалога.
Почему окно «забивается»
Типичные пожиратели объёма — длинные PDF, которые загружают целиком «на всякий случай», накопленная история многочасового диалога и агентные прогоны, где каждый инструмент возвращает простыню текста. Отдельная ловушка — эффект «иглы в стоге сена»: даже внутри огромного окна факты из середины длинной подачи модель замечает хуже, чем из начала и конца.
Поэтому «загрузить всё» — антипаттерн: чем больше нерелевантного текста в окне, тем рассеяннее внимание модели и дороже каждый запрос. Грамотная альтернатива — подавать минимум необходимого: найденный фрагмент вместо целого документа, краткую сводку вместо полной истории. Это одновременно и качество, и экономика решения без покупки лишних лицензий.
Зачем бизнесу
- Выбор модели под задачу: не платить за гигантское окно, если процессу хватает средней модели с грамотной подачей контекста.
- Понимание сбоев: «бот забыл, о чём говорили» — это не каприз модели, а переполненное окно без суммаризации.
- Проектирование RAG: вместо загрузки всей базы — поиск и подача только релевантных фрагментов; об этом же — наш разбор RAG в словаре.
Как работать с ограничением
Чанкинг и поиск вместо полной загрузки документов, суммаризация старой истории диалога, кэширование неизменной части промпта и очистка контекста между логическими сессиями. Сравнение моделей под документооборот — в материале как выбрать LLM для обработки документов.
Как не платить за лишнее окно
На практике стоимость владения растёт с размером окна: дороже инференс, больше памяти, выше требования к ускорителям. Поэтому зрелая архитектура начинается не с выбора «самой большой» модели, а с аудита процесса: сколько токенов реально нужно на запрос, как часто повторяется неизменяемая часть промпта (её выгодно кэшировать), какие документы можно не грузить вовсе. Нередко выясняется, что процессу хватает средней модели, а разница в цене железа уходит в другие задачи.
Цены «от» (сентябрь 2026)
Аудит процессов и данных — от 90 000 ₽ за 3–5 рабочих дней; пилот LLM+RAG с настройкой подачи контекста — от 480 000 ₽ за 4–6 недель; полный промышленный контур — 0,9–1,2 млн ₽. Цены сентября 2026, без НДС (УСН).
С чего начать
Замерьте реальный объём контекста вашего процесса: сколько токенов занимают типовые документы и история. Часто оказывается, что задача решается средней моделью с аккуратным поиском — без переплаты за максимальное окно и связанное с ним железо.