Языковая модель не читает буквы и слова — она оперирует токенами: короткими фрагментами текста, на которые разбивается любая фраза. Один токен — это часть слова, целое слово или символ. Токенизация невидима для пользователя, но от неё зависят три вещи, которые бизнес чувствует напрямую: сколько текста влезет в модель, сколько стоит обработка и как хорошо модель понимает русский язык.
Как считается
Токенизатор строится статистически: частые последовательности символов склеиваются в токены, редкие остаются по частям. Английское «tokenization» может стать двумя токенами, русское «токенизация» — четырьмя-пятью: кириллица в обучающих корпусах встречалась реже и разбита мельче. Правило простое: чем мельче нарезка языка, тем больше токенов на тот же смысл — и тем дороже каждый запрос. Проверить свою нарезку просто: большинство провайдеров публикуют счётчики токенов, а для локальных моделей токенизатор доступен как библиотека.
Почему это про деньги
- Тарифы API считаются за токены: один и тот же документ на русском может «стоить» заметно больше, чем на английском.
- Контекстное окно измеряется в токенах — сколько документов влезет в запрос, определяется нарезкой, а не страницами.
- Скорость тоже за токенами: больше токенов — дольше генерация и выше нагрузка.
- Лимиты и квоты облачных сервисов учитываются в тех же токенах.
Поэтому в проектной смете строка «объём токенов» заслуживает такого же внимания, как количество пользователей: недооценённая нарезка языка съедает бюджет молча. Как считаются совокупные затраты на модель — в материале TCO LLM; про окно контекста — что такое контекстное окно LLM.
Практические следствия
Для интеграций токенизация задаёт и пределы автоматизации: если система собирает промпт из шаблона, документов и истории диалога, «съесть» окно может любая из частей. Инженерный приём — бюджет токенов на каждую составляющую: шаблон столько, документы столько, история столько; превышение обрезается по правилам, а не случайно.
Токенизация объясняет неожиданные эффекты. Модель может «не заметить» лишнюю букву в артикуле, потому что токен-фрагмент встречался ей в обоих вариантах. Подсчёт букв — исторически слабое место LLM — по той же причине. А сокращение базы знаний при загрузке в контекст выгоднее начинать не с удаления текста, а с очистки от повторов и таблиц-дублей: токены тратятся на них впустую.
Зачем бизнесу
- Реальная смета. Понимание токенов превращает «примерно дёшево» в расчётный бюджет инференса.
- Выбор модели. Модели с эффективной кириллической нарезкой снижают стоимость русскоязычных контуров.
- Проектирование контекста. Что именно попадёт в окно модели — решение инженерное и экономическое одновременно.
- Общая валюта контроля. Токен — единая единица для смет, лимитов, алертов и отчётности по расходованию: это снимает половину споров о «непонятных списаниях» за ИИ-сервисы.
Обзор класса моделей и их различий — в материале что такое LLM; как сжатие моделей снижает стоимость локального инференса — что такое квантизация LLM.
Цены «от» (сентябрь 2026)
Прототип — от 90 000 ₽; пилот LLM+RAG с расчётом токен-бюджета — от 480 000 ₽ за 4–6 недель; полный контур — 0,9–1,2 млн ₽. Цены сентября 2026, без НДС (УСН).
С чего начать
Попросите у подрядчика расчёт: сколько токенов занимает типовой документ и типовой диалог вашего сценария и как это конвертируется в стоимость месяца при вашей нагрузке. Один этот вопрос сразу отличает смету, построенную на измерениях, от сметы «на глаз». Дальше контроль сводится к ежемесячному сверению факта с расчётом.