Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Технология · распознавание речи в контуре

Whisper и локальный ASR: как используем в проектах

Разворачиваем локальное распознавание речи: Whisper и faster-whisper для транскрибации встреч, звонков и обращений — данные не покидают контур, а текст сразу уходит в RAG и аналитику.

Краткий ответ · сентябрь 2026

Краткий ответ: Whisper — открытая модель распознавания речи (MIT) от OpenAI: русскоязычная транскрибация встреч, звонков и голосовых сообщений на своём железе, без облака. Быстрее и дешевле в бою — faster-whisper; для потоков на CPU — Vosk. Пилот — от 480 000 ₽ за 4–6 недель.

от 480 000 ₽ — пилот локальной транскрибации за 4–6 недель НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Что такое Whisper и чем локальный ASR отличается от облачного

Whisper — открытая модель распознавания речи, выпущенная OpenAI под лицензией MIT: веса публичны, модель можно скачать и запустить у себя — от компактной tiny до большой large. Русский язык распознаёт уверенно, включая среднюю речь с шумом. На её основе построен faster-whisper — реализация на движке CTranslaate2, которая на том же железе работает в разы быстрее и экономнее по памяти; для CPU-инфраструктуры есть ещё Vosk с российскими корнями и моделями под русский.

Отличие от облачного STT-сервиса — в размещении и экономике: локальный ASR ставится на ваши серверы, записи не покидают контур (требование для персональных данных и служебных разговоров), а стоимость не растёт с каждой минутой аудио — она фиксирована железом. Облачные сервисы при этом остаются удобным вариантом, когда данные можно выносить — мы не идеологи, считаем по задаче.

Задачи, которые решаем локальным ASR

  • Транскрибация совещаний: протокол встречи с таймкодами и распределением по speakers — минуты вместо часов подготовки.
  • Колл-центры: расшифровка записей звонков для речевой аналитики: темы, соблюдение скрипта, тональность — на своих мощностях.
  • Голосовые обращения граждан: сообщения в мессенджерах и по телефону превращаются в текст и дальше — в структурированные заявки для 1С.
  • Диктовка документов: сотрудники надиктовывают служебные записки — ASR + LLM оформляют по шаблону.
  • Архивы записей: пакетная оцифровка многолетних аудиоархивов ночными батчами — затем поиск по содержанию разговоров.

Как применяем: этапы и схема

  1. Обследование аудиопотока. Источники (АТС, диктофоны, мессенджеры), объёмы часов в месяц, качество записи, требование контура.
  2. Подбор конфигурации. Модель Whisper (размерность) против faster-whisper против Vosk — по компромиссу «качество/скорость/железо»; замеряем на образцах ваших записей, а не на общих датасетах.
  3. Развёртывание. Сервис транскрибации на FastAPI: очередь заданий, воркеры на CPU/GPU, идемпотентность, повторные попытки для битых файлов.
  4. Постобработка. Нормализация текста (числа, даты, аббревиатуры), разметка speakers, при необходимости — LLM-полировка в читаемый протокол.
  5. Интеграция. Текст уходит потребителям: полнотекстовый поиск, RAG-индекс, BI-дашборды, тикет-системы, 1С.
  6. Контроль качества. Выборочная сверка с ручной расшифровкой; метрика — доля ошибок на словах (WER) на вашем корпусе; фиксируем в акте.

Текстовая схема: источники аудио (АТС, записи встреч, голосовые) → загрузка → очередь → ASR-воркеры (faster-whisper) → нормализация текста → постобработка LLM → потребители (поиск, аналитика, заявки). Всё — внутри вашего контура.

ФорматЦенаСрок
Аудит аудиопотока и выбор моделиот 90 000 ₽3–5 рабочих дней
Пилот: сервис транскрибации + 2 интеграцииот 480 000 ₽4–6 недель
Промышленный контур: очереди, мониторинг, SLA0,9–1,2 млн ₽4–6 недель
Сопровождениеот 50 000 ₽/месежемесячно

Совместимость с нашим стеком

Локальный ASR — нижний этаж речевого контура, и стыкуется он со всем: расшифровки идут в векторный индекс для поиска по содержанию разговоров; GigaChat или локальная LLM собирают саммари и протоколы; структурные выходы превращают обращение в заявку с полями; 1С получает готовые задачи. Для звонковых сценариев рядом живёт гайд «Как внедрить ИИ-звонки за 7 шагов», для анализа расшифровок — речевая аналитика.

Если записи можно выносить в облако, честно сравниваем с российскими STT-сервисами: на малых объёмах облако проще, на больших и чувствительных — локальный контур выгоднее и безопаснее.

Лицензии и импортозамещение

Whisper — лицензия MIT: свободное коммерческое использование, дообучение, встраивание. faster-whisper — открытая реализация на CTranslate2 (MIT-совместимая лицензия); Vosk — Apache-2.0, развивается с сильной поддержкой русского языка и лёгкими моделями для мобильных и встроенных сценариев. Все три ставятся локально — за пределы вашего контура не выходит ничего.

Для госсектора это решающий аргумент: записи звонков и совещаний часто содержат персональные данные и служебную информацию ограниченного распространения — их обработка внутри периметра на открытом ПО проходит и 152-ФЗ, и требования ИБ. Никаких внешних API, подписок и расчётов за минуты.

Тонкости, которые всплывают в проектах

Первая — качество аудио важнее модели: телефонный узкий канал и эхо портят транскрипт сильнее, чем «не та» версия Whisper; иногда спасает предобработка (нормализация уровня, шумодав). Вторая — спикеры: базовое разделение по голосам — отдельная задача, для протоколов совещаний добавляем diarization и ручную правку имён. Третья — часовые объёмы против железа: считаем пропускную способность (часов аудио в час) и закладываем очередь с ночным догоном. Четвёртая — русская нормализация: «двадцать тыс руб» вместо «20 000 ₽» лечится постобработкой и LLM-полировкой. Всё это выявляется на пилоте — потому и делаем его на ваших записях, а не на синтетике.

Пример: протоколы совещаний от записи до архива

Популярный сценарий локального ASR — протоколы совещаний, и он показывает весь конвейер целиком. У встречи есть диктофонная запись или выгрузка из системы ВКС. Запись попадает в сервис транскрибации: faster-whisper распознаёт речь с таймкодами, слой постобработки приводит числа, даты и суммы к письменному виду, разметка спикеров разделяет реплики по голосам. Дальше LLM получает расшифровку с инструкцией: выделить решения, поручения с исполнителями и сроками, открытые вопросы. На выходе — структурированный протокол и исходная расшифровка рядом.

Протокол уходит туда, где он работает: в систему документооборота, в задачник (поручения становятся задачами с ответственными), в базу знаний (расшифровка индексируется — через месяц можно найти «что решили по срокам поставки» поиском). Всё это не покидает контур организации: ни аудио, ни текст, ни протокол.

Экономика сценария: час совещаний обрабатывается за минуты; секретарь не стенографирует, а проверяет; поручения не теряются в рукописных заметках. Точность распознавания на нормальном аудио достаточна для рабочих протоколов, а спорные места остаются кликабельными — по таймкоду можно вернуться к фрагменту записи и убедиться лично.

Про хранение и права: расшифровки — это персональные данные участников разговора, поэтому контур строится с самого начала с разграничением: кто может слушать запись, кто читать протокол, кто только видеть поручения. Расшифровки и аудио живут в одном контуре с общими правами доступа, сроки хранения — по регламенту заказчика. Технологически это те же механизмы, что в вашем документообороте.

И про интеграцию без боли: сервис транскрибации — обычный API: положили файл, получили идентификатор, забрали текст. Источники подключаются адаптерами — от папки с диктофонными записями до АТС и систем ВКС, без перестройки существующих процессов.

И про то, с чего нельзя начинать: закупка GPU «под Whisper» до аудиообследования. Пока нет образцов записей и оценки часов, конфигурация — гадание; мы видели и переизбыточные серверы, и, наоборот, попытки считать сотни часов на ноутбуке. Один день на аудит аудиопотока экономит недели и сотни тысяч рублей на железе.

Как стартуем

  1. Пришлите 3–5 образцов записей (можно коротких) и оценку часов в месяц — за день скажем, что реально на вашем железе.
  2. На стенде прогоним модели-кандидаты, покажем образцы транскриптов и скорость.
  3. Смета пилота — от 480 000 ₽ за 4–6 недель; КП за 1 рабочий день.

Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.

Смотрите также

Частые вопросы: Whisper и локальный ASR на практике

Whisper — открытая модель распознавания речи (MIT) от OpenAI: русскоязычная транскрибация встреч, звонков и голосовых сообщений на своём железе, без облака. Быстрее и дешевле в бою — faster-whisper; для потоков на CPU — Vosk. Пилот — от 480 000 ₽ за 4–6 недель.

На чистой записи качество высокое; на телефонных звонках и шумных совещаниях падает — и это свойство любых моделей, не только Whisper. Поэтому мы прогоняем образцы ваших записей и меряем долю ошибок на словах до выбора модели. Нормализация чисел, дат и аббревиатур закрывается постобработкой.

На малых объёмах (десятки часов в месяц) облако обычно проще и дешевле. От сотен часов в месяц и при требованиях к периметру локальный контур выигрывает: стоимость фиксирована железом и не растёт с каждой минутой. Точку безубыточности считаем на аудите по вашим объёмам.

CPU-сервер с 8–16 ГБ памяти закрывает небольшие модели faster-whisper и Vosk — хватит для протоколов встреч и голосовых. GPU ускоряет в разы и нужен для больших объёмов и large-моделей. Точную конфигурацию даём после замера на ваших записях — без закупки «с запасом вслепую».

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты — по состоянию на сентябрь 2026 (19.09.2026), из канона ответов для ИИ new-sst.ru. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).