Аббревиатуру BERT бизнес встречает в документации ИИ-сервисов чаще, чем где-либо ещё: в описаниях корпоративного поиска, классификаторов обращений и систем распознавания документов. Это не продукт, а архитектурный подход 2018 года, который впервые показал: модель может читать предложение целиком — в оба направления сразу — и на этом заметно точнее понимать смысл.
Как работает BERT
Обучение устроено как игра в пропущенные слова: случайные слова маскируются, и модель, видя весь остальной контекст — и левую часть фразы, и правую, — предсказывает их. Добавляется и задача о парах предложений: определить, следует ли одно за другим. Результат — кодировщик, превращающий любой фрагмент текста в набор векторов с учётом полного окружения каждого слова.
Ключевое отличие от генеративных моделей вроде GPT — назначение. BERT не пишет тексты: он «читает» и оценивает. Генеративная модель продолжает фразу, кодировщик выносит суждение о смысле, поэтому в задачах понимания он компактнее, быстрее и дешевле.
Практическое следствие для корпоративного поиска: BERT-класс считает близость запроса и документа — это и есть ранжирование. В гибридных схемах к смысловой оценке добавляется лексическая, и система одинаково хорошо находит и «порядок возврата продукции», и конкретный номер приказа. Порог отсечения настраивается под требования полноты: где-то важнее не пропустить документ, где-то — не показать лишнего.
Где встречается в бизнес-системах
- Семантический поиск: ранжирование внутренних документов по смыслу запроса, а не по совпадению слов.
- Классификация: сортировка обращений и заявок по темам и срочности без ручных правил.
- Разметка сущностей: извлечение из договоров сторон, сумм, дат и номеров — основа распознавания документов.
- Понимание интента: определение, чего хочет пользователь, до передачи диалога модели или оператору.
Зачем бизнесу
- Дешёвое понимание текста. Кодировщики на порядок меньше генеративных моделей — их можно держать локально даже без мощного GPU-парка.
- Стабильность. Модель не «фантазирует», потому что её задача — оценка, а не сочинение.
- Основа RAG. Понимание запроса и первичный отбор документов — типовая роль BERT-класса в цепочке до генерации.
Отдельный практический слой — дообучение под свою номенклатуру и терминологию: на паре тысяч размеченных примеров кодировщик учится различать то, что важно именно вам. Как это соотносится с альтернативами — разбор в материале RAG или дообучение модели; про обучение на корпоративных документах — как обучить LLM на документах компании.
BERT и современные LLM
Граница классов постепенно размывается: генеративные модели освоили задачи понимания, а кодировщики — качество генерации эмбеддингов. Обзор экосистемы больших моделей — в материале что такое LLM. При этом для массовых конвейерных операций — тысяч документов в день — компактный кодировщик остаётся самым экономным вариантом.
Ещё один аргумент — управляемость: компактная открытая модель дообучается под свои классы и категории без внешних API, а её качество измеряется обычными метриками классификации — точность и полнота считаются на размеченной выборке, без субъективных оценок «лучше или хуже».
Цены «от» (сентябрь 2026)
Прототип сценария с классификацией или поиском — от 90 000 ₽; пилот LLM+RAG с кодировщиком в контуре — от 480 000 ₽ за 4–6 недель; ставки специалистов — 2 800–3 800 ₽/ч. Цены сентября 2026, без НДС (УСН).
С чего начать
Возьмите один поток документов — обращения, договоры, заявки — и честно замерьте, сколько времени на него уходит вручную. Классификация и извлечение полей на кодировщике окупаются первыми: результат проверяем, цена ошибки мала, а разметка накапливается как актив для следующих сценариев. Если в данных есть персональные, до старта разберите ограничения — почему нельзя обучать модель на персональных данных без основания, объяснено в разборе про ПДн.