Трансформер — архитектура, на которой стоит весь современный ИИ: от моделей в телефоне до систем, пишущих код. Статья 2017 года «Attention Is All You Need» заменила последовательную обработку текста параллельной, и с этого момента качество моделей начало расти вместе с данными и вычислениями — появились и сами «большие языковые модели».
Как работает внимание
Механизм внимания отвечает на вопрос «на что смотреть»: для каждого токена модель вычисляет, насколько важны все остальные, и собирает из них взвешенную сумму. Слово «ключ» во фразе «ключ от склада» получит иные веса окружения, чем в «ключ к решению» — в этом и есть понимание контекста. Несколько слоёв внимания подряд строят всё более абстрактные представления: от синтаксиса к смыслу.
Позиционные кодировки решают задачу порядка: раз внимание само по себе не знает, какое слово идёт раньше, модель добавляет к каждому токену информацию о его позиции. Именно поэтому «собака укусила человека» и «человек укусил собаку» для модели — разные события, хотя набор слов один.
Второе ключевое решение — параллелизм. Предыдущие архитектуры читали текст слово за словом; трансформер обрабатывает всю последовательность одновременно. Это ускорило обучение на порядок и сделало масштабирование предсказуемым: больше данных и GPU — предсказуемо лучше качество.
Семейство архитектур
- Кодировщики (BERT-класс) — понимание текста: поиск, классификация, эмбеддинги.
- Декодеры (GPT-класс) — генерация: диалоги, написание документов, код.
- Кодировщик-декодер (T5-класс) — преобразование: перевод, суммаризация.
- Мультимодальные — текст вместе с изображениями, аудио и видео.
Зачем бизнесу
- Предсказуемость вложений. Качество растёт с масштабом, поэтому инвестиции в данные и инфраструктуру конвертируются в качество предсказуемо.
- Одна архитектура — много задач. Одна и та же модель после разных настроек закрывает поддержку, документы и аналитику.
- Суверенный контур. На той же архитектуре построены российские модели для развёртывания on-premise; требования к большим фундаментальным моделям привязаны к порогу в 1 млрд параметров.
Индустриальный эффект архитектуры точнее всего описывает слово «масштабируемость»: одна и та же базовая модель адаптируется под сотни прикладных задач, а затраты на каждую следующую падают. Появился и рынок готовых моделей — не нужно обучать свою: достаточно выбрать, настроить и встроить в контур с нужными ограничениями по данным и безопасности.
Выбор конкретной модели под задачу и контур — отдельная инженерная работа: сравнение российских моделей — в материале GigaChat или YandexGPT для бизнеса, обзор класса — что такое LLM. Как архитектура связана с объёмом памяти и окном контекста — в статье что такое контекстное окно LLM.
Цены «от» (сентябрь 2026)
Прототип на готовой модели — от 90 000 ₽; пилот LLM+RAG — от 480 000 ₽ за 4–6 недель; полный промышленный контур — 0,9–1,2 млн ₽; ставки специалистов — 2 800–3 800 ₽/ч. Цены сентября 2026, без НДС (УСН).
С чего начать
Архитектуру не выбирают в отрыве от задачи: сначала фиксируется сценарий и требования к данным, затем — модель, инфраструктура и режим развёртывания. Для большинства корпоративных задач выигрыш даёт не «самая большая модель», а правильно собранный контур: модель, поиск по своим данным и контроль вывода. Ориентиры по обязанностям при работе с фундаментальными моделями — в разборе порога 1 млрд параметров. Если контур госсектора — заранее сверьте требования аттестации и закрытого развёртывания: архитектура модели не меняет требований закона, но определяет, какие именно решения попадут в короткий список.