Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Каталог ИИ-моделей · речь · сентябрь 2026

Российские STT-модели и сервисы: каталог GigaAM, Vosk, SaluteSpeech, SpeechKit

Распознавание русской речи — задача, где у России сильные и открытые решения. На странице — каталог из четырёх проверенных систем: две открытые модели (GigaAM, Vosk) и два облачных сервиса (SaluteSpeech, SpeechKit) — с фактами о разработчиках и лицензиях.

Коротко · проверяемые факты · 2026-09-20

Для распознавания русской речи выбирайте: GigaAM (открытая модель Сбера, Apache 2.0) или Vosk (открытая, работает офлайн) — если нужен свой контур; SaluteSpeech (Сбер) или Yandex SpeechKit — если допустимо облако. Развилка «контур или облако» определяется чувствительностью записей, а не качеством.

Внедрение STT в контуре — от 480 000 ₽ (пилот), аудит — от 90 000 ₽ аудит процесса — от 90 000 ₽ · пилот — от 480 000 ₽ · MVP — от 690 000 ₽

Что важно знать о распознавании русской речи

STT (speech-to-text) — перевод аудио в текст: протоколы совещаний, записи звонков, голосовые команды, контроль качества диалогов. В российских проектах выбор обычно сводится к четырём именам: открытые GigaAM и Vosk для собственного контура, облачные SaluteSpeech и SpeechKit для быстрых интеграций. Мировой ориентир — открытый Whisper от OpenAI (лицензия MIT); о его локальном применении у нас есть отдельная страница Whisper и локальный ASR.

Ключевая развилка — не «какая модель точнее в среднем», а где физически обрабатываются записи. Звонки контакт-центра и внутренние совещания — это персональные данные; их передача в облако должна быть решением по политике безопасности, а не случайностью выбора. Поэтому каталог ниже мы строим вокруг двух вопросов: открытость (можно ли скачать) и формат (облако или свой сервер).

Мы не приводим бенчмарки качества: публичные сравнения русских моделей регулярно публикуются сообществом (например, открытые замеры моделей распознавания русской речи), но результат на ваших записях — телефонные каналы, узкая терминология, диалекты — проверяется только пилотом.

Проверенные факты: каталог систем

СистемаРазработчикФормат и лицензия
GigaAMСбер (salute-developers)открытая модель распознавания русской речи, Apache 2.0, код на GitHub; версии GigaAM, GigaAM-v2 и GigaAM-v3 (анонс декабря 2025)
VoskAlpha Cepheiоткрытый офлайн-движок распознавания речи, Apache 2.0; компактные модели, работа без интернета, поддержка десятков языков
SaluteSpeechСбероблачная платформа распознавания и синтеза речи; полностью публичный доступ открыт с июня 2023
Yandex SpeechKitЯндексоблачный сервис в Яндекс Cloud: распознавание (синхронное и потоковое) и синтез, Brand Voice; приватное развёртывание публично не документировано

Сверка — по официальным репозиториям и документации разработчиков, 20 сентября 2026 года. Оговорка по SpeechKit: если для проекта критичен именно on-premise STT, публично доступным решением будут GigaAM или Vosk, а условия приватной поставки облачных сервисов — предмет отдельного запроса вендору.

Варианты развёртывания

Свой контур: GigaAM и Vosk

GigaAM разворачивается на сервере из репозитория Сбера; модель ориентирована на русский язык, и её открытая лицензия Apache 2.0 разрешает коммерческое применение. Vosk создан для офлайна: компактные модели работают даже на слабом железе и терминалах, распознавание идёт без выхода в интернет. Комбинация типична: GigaAM для точности на сервере, Vosk на периферии и мобильных устройствах. Для CPU-инференса применим общий стек (инференс без GPU).

Облако: SaluteSpeech и SpeechKit

Оба сервиса дают готовый API: распознавание файлов и потоков, синтез речи, дополнительные функции (у SpeechKit — Brand Voice для фирменного голоса). Это самый быстрый путь для нечувствительных данных. Ограничения синхронного API SpeechKit — короткие фрагменты (до минуты на файл); длинные записи — через пакетные режимы, что влияет на архитектуру интеграции.

Гибрид

Чувствительные записи — в контур на GigaAM, публичные сценарии (видеозвонки сайта, голосовые виджеты) — в облако. Граница фиксируется регламентом и журналируется.

Как НЬЮ-ССТ внедряет STT

Практический цикл: аудит процессов и форматов записей (от 90 000 ₽) → пилот на ваших записях с оценкой точности и скорости (от 480 000 ₽) → MVP с интеграцией в телефонию, CRM или систему протоколирования (от 690 000 ₽) → промышленное решение с шифрованием, логами и разграничением доступа (0,9–1,2 млн ₽). В пилоте мы замеряем именно ваши условия: канал связи, наличие словаря терминов, требование к диаризации (кто говорил).

Типовые сценарии у наших заказчиков: протоколы совещаний, контроль качества звонков, ИИ-звонки и проверка записей на дипфейк. Сравнение подходов — отечественная STT или Whisper и локальный STT против облачного; про синтез речи — российские TTS.

Практический пример маршрута

Рамка речевого проекта: записи совещаний и звонков стекаются в контур, где GigaAM строит транскрипт с диаризацией, Vosk обслуживает мобильных участников с офлайн-записью, а LLM-слой делает протокол и поручения. Облачный сервис не участвует — записи не покидают периметр. Транскрипты хранятся ограниченный срок, доступ — по ролям, чувствительных данных в логах нет. Пилот стартует с двух отделов: замеряем точность на их каналах, обучаем словарь терминов, затем тиражируем. Итог — протокол совещания через минуту после встречи и полнота поручений без ручной расшифровки.

Частые ошибки при выборе STT

  • Выбор до ответа на вопрос о данных. Пока не решено, могут ли записи покидать контур, выбор «облако или сервер» — гадание, а не проектирование.
  • Замеры на чистых записях. Телефонный канал, шум, перекрёстные реплики и диалекты режут точность; тестируйте на реальном материале.
  • Игнор диаризации. «Кто говорил» — отдельная функция; для протоколов совещаний она обязательна и проверяется отдельно.
  • Отсутствие словаря терминов. Отраслевые аббревиатуры ломают распознавание; адаптация со словарём — штатный этап пилота.
  • STT без судьбы транскрипта. Текст попадает в LLM-контуры — значит, права доступа и журналирование должны проектироваться вместе, а не по факту.

Речевые проекты дают лучший результат, когда STT рассматривается как часть пайплайна с данными, а не изолированная «функция распознавания».

Безопасность и риски

Записи голоса — персональные данные (биометрия — отдельный режим по 152-ФЗ, если она используется). Минимум: шифрование при хранении и передаче, сроки хранения, обезличивание текстовых протоколов, разграничение доступа. Облачные STT добавляют риск передачи третьей стороне — он должен быть явно принят политикой.

Слой ИИ-рисков: транскрипты попадают в LLM-контуры (саммаризация, анализ) — там действуют требования OWASP LLM Top-10 и правила передачи данных между системами. Голосовые технологии атакуются и с другой стороны — дипфейки: про защиту звонков — дипфейк-звонки в бухгалтерию и защита от клонирования голоса. STT-активы вносим в AI BOM.

Смотрите также

Частые вопросы: российские STT-модели

Открытые кандидаты — GigaAM (модель Сбера, Apache 2.0, ориентирована на русский язык) и Vosk (офлайн-движок Apache 2.0, компактные модели для слабого железа). Часто они комбинируются: GigaAM на сервере для точности, Vosk на периферии. Облачные SaluteSpeech и SpeechKit для закрытого контура не подходят по определению — их данные уходят к вендору.

Vosk — офлайн-движок с компактными моделями и поддержкой многих языков, создан для работы без интернета на слабом железе. GigaAM — открытые модели Сбера, целевой язык — русский, версии развиваются с 2023 года (актуальная — GigaAM-v3). Это не конкуренты, а инструменты разных ниш: терминал против сервера.

Публичные замеры существуют, но точность на ваших записях зависит от канала, терминов и числа спикеров. Наш пилот (от 480 000 ₽) размечает выборку ваших записей и даёт протокол: точность распознавания, скорость, стоимость обработки. Без такого протокола любые «проценты точности» — маркетинг.

Публично документированного on-premise варианта SpeechKit нет: сервис работает в Яндекс Cloud. Если запись разговоров не может покидать контур, технический выбор — GigaAM или Vosk; возможность приватной поставки облачных сервисов обсуждается с вендором индивидуально и в проект не закладывается, пока не подтверждена договором.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Разбор вашей задачи — бесплатно, за 1 рабочий день

Пришлите описание задачи — вернёмся с вилкой стоимости, сроками и рисками. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Факты о моделях — по официальным источникам разработчиков (сайты, Hugging Face, документация), проверено 2026-09-20; наши цены — «от», без НДС (УСН). ООО «НЬЮ-ССТ» (ИНН 7733311994) работает с 28.12.2016. Полный каталог направления — ИИ-разработка и защита информации.