Современные системы синтеза речи научились «надевать» чужой голос. Для клонирования достаточно короткого образца — от нескольких секунд до минуты чистой записи; дальше модель воспроизводит тембр, темп, характерные паузы и интонации так, что отличить подделку на слух сложно даже знакомым человека. Технология легальна и полезна — и она же стала двигателем самого быстрорастущего вида мошенничества: звонков «голосом» руководителя, коллеги или родственника.
Контраст с прошлым десятилетием показательный: раньше голосовую подделку делали актёры озвучки и монтаж, и она оставалась дорогой атакой. Нейросети сделали копию голоса общедоступной: образец добывается из публичного видео, вебинара, голосового сообщения в мессенджере. Для компании это означает, что голос любого сотрудника, выступавшего публично, — уже потенциальный инструмент атаки на неё.
Как работает: шаги технологии
- 1. Образец. Сбор записи: публичные видео и подкасты, голосовые сообщения, даже перехваченный звонок. Чем чище образец, тем точнее клон.
- 2. Эмбеддинг голоса. Из образца извлекается числовое представление — «отпечаток» тембра и манеры речи; принцип тот же, что у эмбеддингов текста, только над акустикой.
- 3. Синтез. Модель-синтезатор произносит любой текст с нужной интонацией: вопрос, тревога, приказ — эмоциональная окраска управляется разметкой.
- 4. Доставка. Дипфейк-звонок в реальном времени, голосовое сообщение, аудио в письме. Задача атакующего — не качество звука, а давление сценарием: «срочно», «конфиденциально», «я на совещании».
Сценарии атак на бизнес и людей
- Вишинг «голосом директора». Классика: звонок сотруднику финансовой службы «голосом» собственника — срочно провести платёж контрагенту, проверить счёт, выдать доступ. Голос узнаваем, иерархия срабатывает быстрее сомнений.
- Подтверждение по телефону в цепочке писем. Письмо от «поставщика» с изменённым счётом подкрепляется звонком «менеджера» его голосом — комбинированная атака убедительнее каждого компонента.
- Обход голосовой аутентификации. Там, где вход в колл-центр или приложение подтверждается голосом, клон — готовый ключ. Голос как единственный фактор аутентификации больше не выдерживает угрозу.
- Атаки на частных лиц. «Мама, я попал в беду» с голосом ребёнка; давление на пожилых. Для семей и близких это самая болезненная версия угрозы.
- Компромат и дипфейк-медиа. Сгенерированные аудио «признания» и звонки — инструмент дискредитации; техника расследования та же, что у детекции дипфейков.
Защита: контур мер
- Правило обратного звонка. Любое голосовое распоряжение о деньгах и доступах подтверждается обратным вызовом на известный номер из справочника, а не на тот, с которого звонили. Одна процедура закрывает большинство сценариев.
- Кодовые фразы и второй фактор. Внутренние подтверждения срочных операций — кодовое слово или выход на второй канал (мессенджер с подтверждением личности). Голос никогда не является самоподтверждением.
- Процедура платежей без исключений «для начальства». Вишинг эксплуатирует иерархию: «я директор, выполняй». Регламент, по которому срочность не отменяет визирования, — прививка от этой эксплуатации.
- Голосовая аутентификация — только как один из факторов. В системах с голосовым входом добавляется второй фактор; для критичных операций голос понижается до вспомогательного.
- Детекция синтетической речи. Технологии liveness и антиспуфинга в колл-центрах и голосовых ботах: анализ артефактов синтеза, проверочные вопросы, выявление записей. Параллельно работает watermarking — маркировка синтетического аудио; по закону об ИИ (243-ФЗ) маркировка ИИ-контента в России закреплена как возможность.
- Обучение и тренировки. Сотрудники должны знать, что голос — больше не доказательство личности, а финансовые работники — периодически получать тренировочные звонки с клонированным голосом (с санкции руководства) для закрепления процедуры.
Легитимные применения: где технология работает на бизнес
- Колл-центры и IVR. Единый фирменный голос, озвучка динамических данных, синтез записей вместо студии.
- Медиа и обучение. Аудиокниги, дикторская озвучка курсов, дубляж — с согласия владельца голоса и выплатой гонорара.
- Доступность. Синтез «своего» голоса для людей, потерявших речь, — одно из самых сильных применений технологии.
Правовая рамка: использование голоса человека без согласия нарушает его личные неимущественные права; записи со синтезированным голосом конкретного лица в коммерческих целях требуют договора. У НЬЮ-ССТ защита от голосового фрода входит в аудит ИИ-безопасности (старт от 90 000 ₽): проверка процедур подтверждения, тестовые атаки на колл-центр и регламент реагирования.
Разбор типового сценария атаки
Атаки почти всегда построены по одной драматургии. Подготовка: атакующий собирает образцы голоса — публичное видео с форумов, корпоративные вебинары, голосовые сообщения — и изучает структуру компании из открытых источников: кто кому подчиняется, кто подписывает платежи. Контакт: звонок «первому лицу не нужен» — выбирается сотрудник с правом платежа или доступа и достаточной нагрузкой, чтобы срочность звучала правдоподобно. Давление: легенда строится на трёх китах — срочность («сейчас же, до конца часа»), исключительность («я на переговорах, говорить могу только сейчас»), конфиденциальность («не обсуждай это с коллегами»). Завершение: распоряжение сформулировано так, чтобы его можно было выполнить, не создавая следов до конца дня. Разбор этой драматургии на тренинге работает лучше любой теории: каждый узнаёт сценарий, в котором сам сказал бы «да».
Обратите внимание: качество клонирования голоса в этой схеме — необязательный элемент. Даже средний клон работает, если процедура компании позволяет распоряжение без подтверждения. Значит, и защита обязана стоять в процедуре, а не только в детекторах.
Что спрашивать у подрядчика колл-центра и вендора голосовых сервисов
- Защита голосовой аутентификации. Есть ли антиспуфинг и liveness-проверки, как часто обновляются модели детекции, как тестируются на свежие атаки.
- Хранение записей. Где хранятся голоса клиентов, кто имеет доступ, как ограничивается передача третьим лицам — запись голоса тоже персональные данные.
- Логи и разборы. Ведутся ли записи и метаданные, позволяющие расследовать инцидент постфактум.
- Собственные генеративные функции. Если платформа умеет синтез речи — как контролируется, чей голос клонируется, где согласия владельцев.
Памятка для семей звучит короче: договоритесь о кодовом слове на случай «экстренного» звонка от родных; любых просьб о переводах по телефону — перезвон на обычный номер; голос — не доказательство личности, даже родной. Пожилым родственникам стоит проговорить это вслух — именно они главная мишень бытового вишинга.
Частые заблуждения
- «Мой голос никто не найдёт». Достаточно одного выступления, вебинара или голосового сообщения. Чем публичнее человек, тем доступнее его голос — и тем чаще его клон используют в атаках на его окружение.
- «Я сразу отличу подделку». Исследования и учения показывают обратное: качественные клоны распознают на слух плохо даже знакомые. Доверять нужно процедуре подтверждения, а не ушам.
- «У нас в колл-центре голосовой вход — значит, мы защищены». Голосовая аутентификация без второго фактора теперь сама является уязвимостью: она проверяет как раз то, что научились подделывать.
- «Это касается только больших компаний». Малый бизнес атакуют теми же инструментами по тем же сценариям, а процедур подтверждения у него обычно меньше.
Как техника распознаёт синтетический голос
Детекторы работают по нескольким направлениям сразу. Артефакты синтеза: генераторы оставляют следы в спектрограмме — характерные периодичности, «слишком ровные» переходы, аномалии в высоких частотах, которые человек не слышит, а модель видит. Акустическая нестыковка среды: клон записан «в никуда», а звонок идёт якобы с улицы или машины — фон и реверберация не совпадают с легендой. Поведенческие проверки: спонтанная речь отличается от чтения — просьба повторить фразу задом наперёд, посчитать вразбивку, ответить на вопрос вне сценария даётся синтезу и клону в реальном времени куда хуже, чем живому человеку. Наконец, liveness-механизмы в голосовых каналах: контроль канала и метаданных звонка поверх самого аудио. Для бизнеса важно: ни один детектор не даёт абсолютной гарантии — они работают как сигнализация в связке с процедурой подтверждения, а не вместо неё.
Правовое поле: что можно и что нельзя
Голос человека — личное нематериальное благо: его коммерческое использование требует согласия владельца, и договор на озвучку фиксирует границы — какой контент, какие каналы, какой срок. Клонирование чужого голоса без согласия — основание для требований о защите прав, включая удаление контента и компенсацию. Отдельный пласт — маркировка: по закону об ИИ (243-ФЗ) в России закреплена возможность маркировать ИИ-контент, и для синтетического аудио это самый честный механизм — слушатель должен знать, что говорит не человек. Для компаний практическая рамка проста: свой фирменный синтетический голос — по договору и с маркировкой; чужой голос — только с согласия; голоса сотрудников — по внутреннему регламенту с явным согласием на каждый сценарий использования.
С чего начать
Одним письмом: «Голос — не подтверждение личности. Любое голосовое распоряжение о деньгах или доступах выполняется только после обратного звонка на номер из справочника». Дальше — встройте это правило в регламент платежей и прогоните учебную атаку. Это дешевле любой технологии и защищает уже завтра.