Температура — самый влиятельный параметр генерации, о котором бизнес обычно не знает. Модель выбирает следующее слово вероятностно, и температура задаёт, насколько она готова отступать от самого вероятного продолжения. Один и тот же вопрос при разной температуре даёт разные по характеру ответы: от всегда одинакового, «канцелярского», до разнообразного и неожиданного.
Что происходит технически
На каждом шаге модель назначает вариантам следующего токена вероятности. Температура преобразует это распределение: значения ниже единицы усиливают фаворитов и подавляют аутсайдеров, выше — выравнивают шансы. При температуре около нуля модель всегда берёт самый вероятный токен — ответы становятся воспроизводимыми; при высоких значениях в игру входят маловероятные, но интересные продолжения.
Рядом с температурой живут родственные параметры: top-p ограничивает выбор долей совокупной вероятности, top-k — числом кандидатов. Они работают в связке, и осмысленная настройка всегда проверяется на одном и том же тестовом наборе: иначе сравнивать нечего. В корпоративных системах эти параметры обычно фиксируются конфигурацией, а не оставляются на усмотрение разработчика.
Какие значения для каких задач
| Задача | Ориентир | Почему |
|---|---|---|
| Извлечение данных, классификация | 0–0,3 | Нужна воспроизводимость и строгий формат |
| Клиентский диалог, поддержка | 0,4–0,7 | Живой тон без отступлений от фактов |
| Маркетинговые тексты, идеи | 0,8–1,0 | Нужны вариативность и неожиданные ходы |
| Брейншторм, генерация гипотез | выше 1,0 | Чем страннее, тем ценнее |
Значения — ориентиры, а не стандарт: у каждой модели своя шкала, и точную настройку проверяют на своих примерах. Важно и место применения: во многих API температура задаётся отдельно на запрос, что позволяет одному ассистенту быть точным в извлечении и живым в диалоге. Отдельно про ноль: «жадное» декодирование не всегда идеально даже для классификации — иногда чуть выше нуля снижает зависимость от формулировки. Точную точку ищут измерением.
Температура и галлюцинации
Распространённое заблуждение: «поставим ноль — и модель не будет выдумывать». Ноль делает ответы одинаковыми, но не истинными: если надёжных знаний в параметрах нет, модель будет уверенно повторять одну и ту же ошибку. От выдумок лечит подача фактов в контекст — RAG и контроль источников, о чём подробно в почему LLM галлюцинирует и что такое галлюцинации LLM. Температура управляет характером текста, а не правдивостью.
Зачем бизнесу
- Стабильность процессов. Нулевая температура для интеграций: одинаковые входы дают одинаковые выходы.
- Экономия токенов. Короткие детерминированные ответы дешевле развёрнутых «размышлений».
- Контроль тона. Настройка под голос бренда без дообучения модели.
Температура в продукте
Практика продуктовых команд: температура выносится в конфигурацию сценария, а не в код. Сценарий «извлечение реквизитов» — ноль, сценарий «вежливое уточнение» — середина шкалы, сценарий «черновик поста» — выше. Так один и тот же ассистент ведёт себя предсказуемо по-разному, а изменение поведения становится контролируемым изменением конфигурации с тестами, а не «подкручиванием на проде».
Цены «от» (сентябрь 2026)
Прототип с настроенными параметрами генерации — от 90 000 ₽; пилот LLM+RAG — от 480 000 ₽ за 4–6 недель; MVP с интеграциями — от 690 000 ₽ за 2–3 недели. Цены сентября 2026, без НДС (УСН).
С чего начать
Проверьте, какая температура стоит в ваших ИИ-сервисах по умолчанию: часто это 0,7–1,0 — «разговорная» настройка, вредная для извлечения данных и классификации. Разбор типовых ошибок внедрения — в материале что делать, если ИИ выдаёт ошибки. Заодно снимите метрику повторяемости: прогоните десять раз типовой запрос и посмотрите, насколько различаются ответы. Для конвейерных сценариев разброс — прямой источник брака в последующей обработке.