Как работает распознавание русской речи
Современный speech-to-text — это связка нескольких моделей. Акустическая модель превращает звук в последовательность фонетических гипотез. Языковая модель выбирает из гипотез наиболее правдоподобные слова — именно она «достраивает» падежи и отличает «столов» от «столбов» по контексту. Диаризация размечает, кто говорил и когда, — без неё расшифровка диалога сливается в кашу. Нормализация приводит «двадцать пятого ноль девятого» к «25.09», а суммы — к цифрам.
- Русская специфика. Богатая морфология (падежи, склонения числительных), свободный порядок слов, сокращения и аббревиатуры («ГОСТ», «СМЭВ», «154-ФЗ») — всё это ложится на языковую модель, поэтому «английский» движок с русским словарём заметно проигрывает изначально русскоязычному.
- Телефонное качество. Узкая полоса 8 кГц, сжатие, перекрёстная речь — для колл-центров выпускаются модели, обученные именно на телефонном звуке.
- Тайм-коды и пунктуация. Зрелые системы возвращают не «полотно», а структурированную расшифровку: реплики по говорящим, время, знаки препинания, абзацы по темам.
Зачем бизнесу расшифровка: речь становится данными
Пока звонок — это аудиофайл, он недоступен ни поиску, ни аналитике. Расшифровка превращает голосовые данные в текстовые, а дальше работает весь стек LLM:
| Сценарий | Что даёт расшифровка | Кто использует |
|---|---|---|
| Контроль качества колл-центра | 100% диалогов вместо прослушки 2% записей; тревоги на нарушения скрипта | Поддержка, продажи |
| Аналитика спроса | Частотность вопросов и возражений из реальных звонков | Маркетинг, продукт |
| CRM после звонка | Автосуммаризация: итог, договорённости, задачи — в карточку клиента | Отделы продаж |
| Протоколы совещаний | Решения и поручения с тайм-кодами вместо ручного протокола | Менеджмент, проекты |
| Голосовые порталы и IVR | Свободная речь вместо тонового меню: «продиктуйте номер заявки» | Госсектор, сервисы |
Голосовые роботы используют обратную связку — text-to-speech; вместе они образуют контур ИИ-звонков, а классические каналы — голосовых порталов и IVR.
Точность, данные и закон
Как мерить точность. Стандартная метрика — WER (доля ошибочно распознанных слов), но решение о внедрении принимается не по бенчмаркам, а по тесту на своих записях: телефония компании, словарь отрасли, реальные акценты. Персональные данные. Записи звонков с клиентами — ПДн: обязательны информирование о записи, цель обработки, сроки хранения и ограничение доступа; при использовании облачных сервисов — договор обработки ПДн. Локальное развёртывание (открытые модели в контуре) снимает риск передачи аудио наружу — тот же паттерн, что в on-premise LLM. Хранение. Зрелый контур хранит расшифровку отдельно от аудио и шифрует оба слоя.
Сколько стоит контур расшифровки (сентябрь 2026)
Прототип: расшифровка потока записей одного отдела, выгрузка в CSV/CRM — от 90 000 ₽. Пилот: 4–6 недель, диаризация, суммаризация звонков, интеграция с CRM, права доступа — от 480 000 ₽. Промышленный контур: все линии, аналитика, тревоги качества, локальное развёртывание — от 690 000 ₽. Облачные API распознавания тарифицируются поминутно; при больших объёмах локальная модель окупается за месяцы.
Ошибки и что с ними делать
Типовые слабые места русских расшифровок — имена собственные (фамилии, топонимы, бренды), числа и артикулы, узкие термины отрасли. Практика закрытия: пользовательский словарь (модель подсказывает, что «СМЭВ» и «ЕГАИС» — это слова), нормализация в структуру (суммы и даты — полями, а не текстом) и порог уверенности — места, где модель сомневается, помечаются на вычитку. Для юридически значимых протоколов остаётся этап лёгкой человеческой сверки по тайм-кодам.
Как начать
Возьмите одну линию или один тип встреч, выгрузите 30–60 записей и получите расшифровку с эталонной разметкой: по ней видно, где система теряет точность (имена, цифры, перекрёстная речь) и сколько ручной правки остаётся. Дальше — подключение к CRM и метрика «минуты ручного разбора, сэкономленные в неделю». Внедрение — ИИ-звонки и голосовые решения new-sst.ru; смежный словарный термин — ИИ-ассистент.