Феномен открыли ещё на классических задачах распознавания изображений: к фотографии панды добавляют шум, невидимый глазу, — и сеть с уверенностью 99% объявляет панду гиббоном. Человек разницы не видит, модель — видит принципиально иначе. Состязательный пример — это вход, лежащий рядом с нормальным, но смещённый ровно туда, где граница решений модели уязвима.
Причина уязвимости фундаментальна: нейросети проводят границы решений по признакам, которые не совпадают с человеческими. Модель опирается на статистические закономерности в данных, и часть этих закономерностей хрупка — специально подобранное возмущение ломает их, не меняя смысла для человека. Полностью «вылечить» это свойство не удалось ни одной архитектуре, включая трансформеры, на которых построены современные LLM, — об их устройстве — в статье трансформеры.
Как работает атака: по шагам
- Шаг 1. Цель. Атакующий выбирает: безразличная ошибка (любая ошибка сойдёт) или целевая (нужно, чтобы «стоп-знак» читался как «ограничение 60»).
- Шаг 2. Подбор возмущения. Если устройство модели известно (white-box), возмущение считается математически — по градиентам: в какую сторону сдвинуть пиксели, чтобы уверенность в нужном классе росла. Если модель чёрный ящик (black-box), атакующий обучает «заместителя» и переносит на него атаки — выяснено, что обманувшие одну модель возмущения часто обманывают и другие.
- Шаг 3. Доставка. В цифре — изменённый файл или строка. В физическом мире — стикер на дорожном знаке, узор на футболке, сбивающий детектор человека, специальные очки, меняющие личность в системе распознавания лиц, звуковая команда, неразличимая для человека, но слышимая для ассистента.
- Шаг 4. Результат. Система уверенно ошибается: доступ открыт, транзакция пропущена, вредный контент прошёл модерацию.
Для языковых моделей состязательные приёмы тоже существуют: суффиксы из бессмысленных токенов, снимающие отказы модели, трюки с юникодом, гомоглифы — латинские буквы, выглядящие как кириллические. Они родственны джейлбрейку LLM, но важно различать: джейлбрейк переубеждает модель словами, состязательный пример — ломает восприятие любого классификатора, от камеры до антиспама.
Где атака встречается на практике
- СКУД и видеонаблюдение. Распознавание лиц и силуэтов: очки, рисунки, инфракрасные точки на кепке.
- Автопилоты и беспилотники. Дорожные знаки и разметка — классическая демонстрация исследователей с наклейками.
- Антифрод и скоринг. Малые, «шумоподобные» изменения транзакционных данных, сдвигающие решение модели.
- Голосовые интерфейсы. Скрытые голосовые команды в аудио и даже в записях, звучащих как обычная речь.
- Фильтры контента. Возмущения изображений и текста, проводящие запрещённый контент мимо ИИ-модерации.
Защита: инженерный минимум
- Состязательное обучение. Модель обучают в том числе на состязательных примерах — устойчивость растёт, хотя и не становится абсолютной.
- Обнаружение аномалий на входе. Проверка входных данных на «странности»: статистика пикселей, энтропия строк, неожиданные кодировки — до основного классификатора.
- Дублирование решений. Ансамбль моделей или мультикамерный охват: одно возмущение редко обманывает все модели одновременно.
- Критичные решения — с человеком. Там, где цена ошибки высока (доступ, платёж), решение модели — рекомендация, а финальный гейт — человек или второй независимый механизм.
- Мониторинг уверенности и расхождений. Резкие скачки уверенности, расхождения моделей друг с другом — триггеры для разбора.
- Регулярные проверки красной командой с физическими и цифровыми сценариями под вашу среду — как устроено, рассказано в материале красная команда по ИИ.
Зачем бизнесу разбираться в теме
- Скорость внедрения CV-систем опережает безопасность. Камеры с аналитикой ставятся в рознице, на заводах и КПП быстрее, чем проверяются на устойчивость.
- Модель из коробки не защищена. Вендорская модель без состязательного дообучания уязвима к переносу атак — это показано на многих системах.
- Комплаенс и сертификация. Для систем физической безопасности и госзаказчиков тесты на устойчивость к искажениям входа становятся частью приёмки.
- Стоимость ошибки. Один пропущенный по «очкам» доступ или проведённый мимо антифрода платёж перекрывает бюджет на тестирование.
У НЬЮ-ССТ тесты устойчивости входят в аудит ИИ-безопасности — старт от 90 000 ₽: проверяем ваши модели на искажения входа, собираем типовые атаки под вашу среду и настраиваем контур защиты.
Физический мир против цифрового: где атака проще
Цифровая среда удобна атакующему: возмущение вносится точно, проверяется мгновенно, повторяется бесплатно. Физическая — жёстче: наклейка должна держаться под дождём, очки — работать при разном освещении, звук — переживать микрофон и шум. Долгое время это утешало владельцев «железных» систем. Однако исследования и демонстрации показали: физические атаки воспроизводимы и устойчивы, если атакующий контролирует условия съёмки — камеру на въезде, ракурс, расстояние. Практический вывод: физические точки входа (шильды, знаки, экраны, лицо перед камерой) должны рассматриваться как атакуемая поверхность наравне с цифровыми.
Вторая особенность физического мира — экономика: подготовка физического возмущения дороже, зато и живёт оно дольше. Одна наклейка на камере контроля въезда работает круглосуточно. Поэтому для периметральных систем регулярный осмотр самих датчиков — часть контура безопасности наравне с программными обновлениями.
Как тестировать устойчивость модели
Тестирование на состязательную устойчивость строится по той же логике, что и обычное тестирование качества, но с обратной целью: не подтвердить, что модель хороша, а найти, где она ломается. Сначала описываются реальные каналы воздействия на вход: что атакующий может изменить — файл, звук, физический объект перед камерой, текст запроса. Для каждого канала генерируются возмущения трёх уровней: незаметные (пиксельный шум), заметные, но не меняющие смысл (наклейка, приглушённый фон), и грубые (смена формата, обрезка). Модель прогоняется по всем уровням, фиксируются ошибки и уверенность модели при них.
Ключевой вопрос теста — не «падает ли модель» (она падает почти всегда при достаточном бюджете возмущения), а «какой бюджет возмущения нужен для ошибки, влияющей на бизнес». Ответ даёт порог приёмки: система выдерживает искажения до такого-то уровня, при превышении — срабатывает контроль. Этот порог и попадает в регламент эксплуатации.
Частые заблуждения
- «Наша модель проприетарная — её не сломают». Состязательные атаки переносятся между моделями: пример, обманывающий одну, часто обманывает и другую, обученную на похожих данных. Скрытость архитектуры — слабая защита.
- «Достаточно проверить модель один раз». Каждое дообучение и обновление меняет границы решений — вместе с ними меняются и уязвимости. Тесты устойчивости повторяются с каждым релизом, как обычные регрессионные тесты.
- «Человек всё равно перепроверяет». Проверяет — если решение модели подано как рекомендация. Если оно тихо влияет на приоритеты, сортировку и фильтрацию, человек его не видит. Инвентаризация точек, где решение модели невидимо, — половина защиты.
- «Это касается только автопилотов». Любая нейросеть, принимающая решения по входу, который может повлиять посторонний, уязвима: от фильтра резюме до распознавания документов и антифрода.
Мини-глоссарий: язык состязательных атак
- Состязательный пример. Конкретный вход с подобранным возмущением: выглядит нормально, приводит к ошибке.
- Бюджет возмущения. Допустимая «сила» изменения входа, обычно ограничение на величину отклонения пикселей или символов. Чем меньше бюджет, при котором модель ошибается, тем она уязвимее.
- White-box и black-box. Первый — атакующий знает устройство модели и считает возмущение точно; второй — работает только через запросы к системе. Промежуточный серый вариант использует заместителя: атакующий обучает свою модель-имитацию.
- Перенос атак. Явление, из-за которого скрытость модели мало помогает: возмущение, найденное на одной модели, с заметной вероятностью обманывает и другие.
- Состязательное обучение. Защита: модель тренируют в том числе на состязательных примерах, чтобы границы решений стали устойчивее.
Эти пять терминов покрывают большинство разговоров с подрядчиком об устойчивости моделей. Если тестовое предложение не оперирует ни бюджетом возмущения, ни методами генерации примеров — перед вами проверка качества, а не проверка безопасности; это разные работы.
Регуляторный горизонт
В России обязательной сертификации нейросетей на состязательную устойчивость нет; требования формируются отраслевыми стандартами и техзаданиями заказчиков — в первую очередь там, где модели работают с физической безопасностью и персональными данными. Закон об ИИ (243-ФЗ) задаёт рамку ответственного развития технологий, не детализируя технические тесты. На практике рычаг — закупочный: заказчик, который включает в ТЗ пункт об устойчивости к искажениям входа с описанием методики и порогов, получает проверяемую систему; заказчик, который не включает, получает демо. Международный контекст движется в ту же сторону: регуляторы всё чаще ожидают от поставщиков ИИ-систем документированных тестов надёжности, и состязательная устойчивость — один из стандартных пунктов таких наборов.
С чего начать
Выпишите, где нейросеть в вашем процессе принимает решение без человека: распознавание, классификация, фильтрация. Для каждой точки ответьте: что подаётся на вход, может ли посторонний повлиять на этот вход, что происходит при ошибке. Уже этот список покажет, где тест на состязательные атаки нужен первым.