Что такое Whisper и чем локальный ASR отличается от облачного
Whisper — открытая модель распознавания речи, выпущенная OpenAI под лицензией MIT: веса публичны, модель можно скачать и запустить у себя — от компактной tiny до большой large. Русский язык распознаёт уверенно, включая среднюю речь с шумом. На её основе построен faster-whisper — реализация на движке CTranslaate2, которая на том же железе работает в разы быстрее и экономнее по памяти; для CPU-инфраструктуры есть ещё Vosk с российскими корнями и моделями под русский.
Отличие от облачного STT-сервиса — в размещении и экономике: локальный ASR ставится на ваши серверы, записи не покидают контур (требование для персональных данных и служебных разговоров), а стоимость не растёт с каждой минутой аудио — она фиксирована железом. Облачные сервисы при этом остаются удобным вариантом, когда данные можно выносить — мы не идеологи, считаем по задаче.
Задачи, которые решаем локальным ASR
- Транскрибация совещаний: протокол встречи с таймкодами и распределением по speakers — минуты вместо часов подготовки.
- Колл-центры: расшифровка записей звонков для речевой аналитики: темы, соблюдение скрипта, тональность — на своих мощностях.
- Голосовые обращения граждан: сообщения в мессенджерах и по телефону превращаются в текст и дальше — в структурированные заявки для 1С.
- Диктовка документов: сотрудники надиктовывают служебные записки — ASR + LLM оформляют по шаблону.
- Архивы записей: пакетная оцифровка многолетних аудиоархивов ночными батчами — затем поиск по содержанию разговоров.
Как применяем: этапы и схема
- Обследование аудиопотока. Источники (АТС, диктофоны, мессенджеры), объёмы часов в месяц, качество записи, требование контура.
- Подбор конфигурации. Модель Whisper (размерность) против faster-whisper против Vosk — по компромиссу «качество/скорость/железо»; замеряем на образцах ваших записей, а не на общих датасетах.
- Развёртывание. Сервис транскрибации на FastAPI: очередь заданий, воркеры на CPU/GPU, идемпотентность, повторные попытки для битых файлов.
- Постобработка. Нормализация текста (числа, даты, аббревиатуры), разметка speakers, при необходимости — LLM-полировка в читаемый протокол.
- Интеграция. Текст уходит потребителям: полнотекстовый поиск, RAG-индекс, BI-дашборды, тикет-системы, 1С.
- Контроль качества. Выборочная сверка с ручной расшифровкой; метрика — доля ошибок на словах (WER) на вашем корпусе; фиксируем в акте.
Текстовая схема: источники аудио (АТС, записи встреч, голосовые) → загрузка → очередь → ASR-воркеры (faster-whisper) → нормализация текста → постобработка LLM → потребители (поиск, аналитика, заявки). Всё — внутри вашего контура.
| Формат | Цена | Срок |
|---|---|---|
| Аудит аудиопотока и выбор модели | от 90 000 ₽ | 3–5 рабочих дней |
| Пилот: сервис транскрибации + 2 интеграции | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: очереди, мониторинг, SLA | 0,9–1,2 млн ₽ | 4–6 недель |
| Сопровождение | от 50 000 ₽/мес | ежемесячно |
Совместимость с нашим стеком
Локальный ASR — нижний этаж речевого контура, и стыкуется он со всем: расшифровки идут в векторный индекс для поиска по содержанию разговоров; GigaChat или локальная LLM собирают саммари и протоколы; структурные выходы превращают обращение в заявку с полями; 1С получает готовые задачи. Для звонковых сценариев рядом живёт гайд «Как внедрить ИИ-звонки за 7 шагов», для анализа расшифровок — речевая аналитика.
Если записи можно выносить в облако, честно сравниваем с российскими STT-сервисами: на малых объёмах облако проще, на больших и чувствительных — локальный контур выгоднее и безопаснее.
Лицензии и импортозамещение
Whisper — лицензия MIT: свободное коммерческое использование, дообучение, встраивание. faster-whisper — открытая реализация на CTranslate2 (MIT-совместимая лицензия); Vosk — Apache-2.0, развивается с сильной поддержкой русского языка и лёгкими моделями для мобильных и встроенных сценариев. Все три ставятся локально — за пределы вашего контура не выходит ничего.
Для госсектора это решающий аргумент: записи звонков и совещаний часто содержат персональные данные и служебную информацию ограниченного распространения — их обработка внутри периметра на открытом ПО проходит и 152-ФЗ, и требования ИБ. Никаких внешних API, подписок и расчётов за минуты.
Тонкости, которые всплывают в проектах
Первая — качество аудио важнее модели: телефонный узкий канал и эхо портят транскрипт сильнее, чем «не та» версия Whisper; иногда спасает предобработка (нормализация уровня, шумодав). Вторая — спикеры: базовое разделение по голосам — отдельная задача, для протоколов совещаний добавляем diarization и ручную правку имён. Третья — часовые объёмы против железа: считаем пропускную способность (часов аудио в час) и закладываем очередь с ночным догоном. Четвёртая — русская нормализация: «двадцать тыс руб» вместо «20 000 ₽» лечится постобработкой и LLM-полировкой. Всё это выявляется на пилоте — потому и делаем его на ваших записях, а не на синтетике.
Пример: протоколы совещаний от записи до архива
Популярный сценарий локального ASR — протоколы совещаний, и он показывает весь конвейер целиком. У встречи есть диктофонная запись или выгрузка из системы ВКС. Запись попадает в сервис транскрибации: faster-whisper распознаёт речь с таймкодами, слой постобработки приводит числа, даты и суммы к письменному виду, разметка спикеров разделяет реплики по голосам. Дальше LLM получает расшифровку с инструкцией: выделить решения, поручения с исполнителями и сроками, открытые вопросы. На выходе — структурированный протокол и исходная расшифровка рядом.
Протокол уходит туда, где он работает: в систему документооборота, в задачник (поручения становятся задачами с ответственными), в базу знаний (расшифровка индексируется — через месяц можно найти «что решили по срокам поставки» поиском). Всё это не покидает контур организации: ни аудио, ни текст, ни протокол.
Экономика сценария: час совещаний обрабатывается за минуты; секретарь не стенографирует, а проверяет; поручения не теряются в рукописных заметках. Точность распознавания на нормальном аудио достаточна для рабочих протоколов, а спорные места остаются кликабельными — по таймкоду можно вернуться к фрагменту записи и убедиться лично.
Про хранение и права: расшифровки — это персональные данные участников разговора, поэтому контур строится с самого начала с разграничением: кто может слушать запись, кто читать протокол, кто только видеть поручения. Расшифровки и аудио живут в одном контуре с общими правами доступа, сроки хранения — по регламенту заказчика. Технологически это те же механизмы, что в вашем документообороте.
И про интеграцию без боли: сервис транскрибации — обычный API: положили файл, получили идентификатор, забрали текст. Источники подключаются адаптерами — от папки с диктофонными записями до АТС и систем ВКС, без перестройки существующих процессов.
И про то, с чего нельзя начинать: закупка GPU «под Whisper» до аудиообследования. Пока нет образцов записей и оценки часов, конфигурация — гадание; мы видели и переизбыточные серверы, и, наоборот, попытки считать сотни часов на ноутбуке. Один день на аудит аудиопотока экономит недели и сотни тысяч рублей на железе.
Как стартуем
- Пришлите 3–5 образцов записей (можно коротких) и оценку часов в месяц — за день скажем, что реально на вашем железе.
- На стенде прогоним модели-кандидаты, покажем образцы транскриптов и скорость.
- Смета пилота — от 480 000 ₽ за 4–6 недель; КП за 1 рабочий день.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.