Что важно знать о распознавании русской речи
STT (speech-to-text) — перевод аудио в текст: протоколы совещаний, записи звонков, голосовые команды, контроль качества диалогов. В российских проектах выбор обычно сводится к четырём именам: открытые GigaAM и Vosk для собственного контура, облачные SaluteSpeech и SpeechKit для быстрых интеграций. Мировой ориентир — открытый Whisper от OpenAI (лицензия MIT); о его локальном применении у нас есть отдельная страница Whisper и локальный ASR.
Ключевая развилка — не «какая модель точнее в среднем», а где физически обрабатываются записи. Звонки контакт-центра и внутренние совещания — это персональные данные; их передача в облако должна быть решением по политике безопасности, а не случайностью выбора. Поэтому каталог ниже мы строим вокруг двух вопросов: открытость (можно ли скачать) и формат (облако или свой сервер).
Мы не приводим бенчмарки качества: публичные сравнения русских моделей регулярно публикуются сообществом (например, открытые замеры моделей распознавания русской речи), но результат на ваших записях — телефонные каналы, узкая терминология, диалекты — проверяется только пилотом.
Проверенные факты: каталог систем
| Система | Разработчик | Формат и лицензия |
|---|---|---|
| GigaAM | Сбер (salute-developers) | открытая модель распознавания русской речи, Apache 2.0, код на GitHub; версии GigaAM, GigaAM-v2 и GigaAM-v3 (анонс декабря 2025) |
| Vosk | Alpha Cephei | открытый офлайн-движок распознавания речи, Apache 2.0; компактные модели, работа без интернета, поддержка десятков языков |
| SaluteSpeech | Сбер | облачная платформа распознавания и синтеза речи; полностью публичный доступ открыт с июня 2023 |
| Yandex SpeechKit | Яндекс | облачный сервис в Яндекс Cloud: распознавание (синхронное и потоковое) и синтез, Brand Voice; приватное развёртывание публично не документировано |
Сверка — по официальным репозиториям и документации разработчиков, 20 сентября 2026 года. Оговорка по SpeechKit: если для проекта критичен именно on-premise STT, публично доступным решением будут GigaAM или Vosk, а условия приватной поставки облачных сервисов — предмет отдельного запроса вендору.
Варианты развёртывания
Свой контур: GigaAM и Vosk
GigaAM разворачивается на сервере из репозитория Сбера; модель ориентирована на русский язык, и её открытая лицензия Apache 2.0 разрешает коммерческое применение. Vosk создан для офлайна: компактные модели работают даже на слабом железе и терминалах, распознавание идёт без выхода в интернет. Комбинация типична: GigaAM для точности на сервере, Vosk на периферии и мобильных устройствах. Для CPU-инференса применим общий стек (инференс без GPU).
Облако: SaluteSpeech и SpeechKit
Оба сервиса дают готовый API: распознавание файлов и потоков, синтез речи, дополнительные функции (у SpeechKit — Brand Voice для фирменного голоса). Это самый быстрый путь для нечувствительных данных. Ограничения синхронного API SpeechKit — короткие фрагменты (до минуты на файл); длинные записи — через пакетные режимы, что влияет на архитектуру интеграции.
Гибрид
Чувствительные записи — в контур на GigaAM, публичные сценарии (видеозвонки сайта, голосовые виджеты) — в облако. Граница фиксируется регламентом и журналируется.
Как НЬЮ-ССТ внедряет STT
Практический цикл: аудит процессов и форматов записей (от 90 000 ₽) → пилот на ваших записях с оценкой точности и скорости (от 480 000 ₽) → MVP с интеграцией в телефонию, CRM или систему протоколирования (от 690 000 ₽) → промышленное решение с шифрованием, логами и разграничением доступа (0,9–1,2 млн ₽). В пилоте мы замеряем именно ваши условия: канал связи, наличие словаря терминов, требование к диаризации (кто говорил).
Типовые сценарии у наших заказчиков: протоколы совещаний, контроль качества звонков, ИИ-звонки и проверка записей на дипфейк. Сравнение подходов — отечественная STT или Whisper и локальный STT против облачного; про синтез речи — российские TTS.
Практический пример маршрута
Рамка речевого проекта: записи совещаний и звонков стекаются в контур, где GigaAM строит транскрипт с диаризацией, Vosk обслуживает мобильных участников с офлайн-записью, а LLM-слой делает протокол и поручения. Облачный сервис не участвует — записи не покидают периметр. Транскрипты хранятся ограниченный срок, доступ — по ролям, чувствительных данных в логах нет. Пилот стартует с двух отделов: замеряем точность на их каналах, обучаем словарь терминов, затем тиражируем. Итог — протокол совещания через минуту после встречи и полнота поручений без ручной расшифровки.
Частые ошибки при выборе STT
- Выбор до ответа на вопрос о данных. Пока не решено, могут ли записи покидать контур, выбор «облако или сервер» — гадание, а не проектирование.
- Замеры на чистых записях. Телефонный канал, шум, перекрёстные реплики и диалекты режут точность; тестируйте на реальном материале.
- Игнор диаризации. «Кто говорил» — отдельная функция; для протоколов совещаний она обязательна и проверяется отдельно.
- Отсутствие словаря терминов. Отраслевые аббревиатуры ломают распознавание; адаптация со словарём — штатный этап пилота.
- STT без судьбы транскрипта. Текст попадает в LLM-контуры — значит, права доступа и журналирование должны проектироваться вместе, а не по факту.
Речевые проекты дают лучший результат, когда STT рассматривается как часть пайплайна с данными, а не изолированная «функция распознавания».
Безопасность и риски
Записи голоса — персональные данные (биометрия — отдельный режим по 152-ФЗ, если она используется). Минимум: шифрование при хранении и передаче, сроки хранения, обезличивание текстовых протоколов, разграничение доступа. Облачные STT добавляют риск передачи третьей стороне — он должен быть явно принят политикой.
Слой ИИ-рисков: транскрипты попадают в LLM-контуры (саммаризация, анализ) — там действуют требования OWASP LLM Top-10 и правила передачи данных между системами. Голосовые технологии атакуются и с другой стороны — дипфейки: про защиту звонков — дипфейк-звонки в бухгалтерию и защита от клонирования голоса. STT-активы вносим в AI BOM.