Определение без мистики
ИИ-RED (AI red teaming) — это регулярные целенаправленные атаки на ИИ-системы организации, проводимые её же интересами: поиском того, как система ведёт себя под атакующим давлением, до встречи с реальным противником. Слово «красная» — из военной традиции учений: выделенная группа играет роль атакующего. Применительно к искусственному интеллекту роль противника исполняют специалисты, которые убеждают модели, отравляют контекст, провоцируют агентов на лишние действия и проверяют, что из этого получается.
Три признака отличают зрелую практику от хаотичного тестирования. Целенаправленность: атаки строятся под конкретные сценарии ущерба, а не «попробуем всякое». Систематичность: результаты собираются в измеримую картину, сопоставимую от цикла к циклу. Регулярность: система меняется — и проверки повторяются по триггерам изменений, а не раз в вечность.
Чем ИИ-RED не является
Не аудит. Аудит ИИ-систем сверяет фактическое состояние с требованиями: есть ли реестр, политика, права, документация. Работа идёт по документам и конфигурациям. Красная команда атакует поведение: ей неважно, что написано в политике, — важно, что реально происходит при попытке инъекции. Первое отвечает «соответствует ли», второе — «держит ли».
Не классический пентест. Инфраструктурное тестирование на проникновение ищет уязвимости сетей, серверов, приложений; ИИ там — ещё одно приложение. Красная команда по ИИ атакует сам генеративный слой: поведение модели, конвейер данных, права агентов, качество фильтров. Идеальный охват получается сочетанием: пентест по периметру, ИИ-RED по интеллектуальному слою.
Не разовая услуга «на всякий случай». Отчёт, полежавший полгода, описывает уже не вашу систему. Ценность — в цикле: атака, устранение, повторная атака.
Что атакует красная команда
- Поведение моделей: промпт-инъекции во всех формах, джейлбрейки, выманивание служебного контекста, проверка устойчивости к переформулировкам.
- Конвейер данных: закладки в документах и страницах, влияние внешнего контента на ответы, утечки через выдачу поиска по базам знаний.
- Агентов и права: попытки расширить привилегии через уговоры модели, несанкционированные вызовы инструментов, действия за пределами сценария.
- Обработку вывода: генерация вредоносной разметки, команд и ссылок с проверкой, что останавливает их на пути к исполнению.
- Человеческое звено: машинные сводки и легенды, через которые дезинформация доходит до операторов и клиентов.
Формы организации
| Модель | Как работает | Кому подходит |
|---|---|---|
| Внутренняя ячейка | выделенные люди в штате | крупным платформам с постоянным потоком изменений |
| Внешняя команда | подрядчик по циклам | большинству компаний без своего red-team отдела |
| Смешанная | внутренний координатор плюс внешние исполнители | среднему бизнесу с несколькими ИИ-сервисами |
| Инструментальная база | автоматизированные прогоны корпусов атак | всем как регулярный слой между циклами с людьми |
Для российского корпоративного контура внешний цикл с инструментальной поддержкой — наиболее реалистичный старт: не требуется держать редких специалистов в штате, а частота прогонов закрывает главный риск — устаревание результатов.
Регуляторный и деловой контекст
Внимание к безопасности ИИ-систем в России растёт по двум линиям. Первая — общий режим защиты информации: утечки персональных данных через любой канал, включая ИИ-сервисы, караются по КоАП в редакции закона от 30.11.2024 № 420-ФЗ (от 3 до 20 млн рублей в зависимости от масштаба, оборотные штрафы за повторность), а требования к защищённости государственных систем обеспечиваются приказами ФСТЭК, среди ключевых — приказ от 11.04.2025 № 117, действующий с 01.03.2026. Вторая линия — профильное регулирование: федеральный закон от 26.07.2026 № 243-ФЗ о поддержке развития технологий ИИ; обязанности для разработчиков больших фундаментальных моделей подключаются с 01.03.2027, собственных штрафов закон не вводит.
Деловой аргумент проще регуляторного: ИИ-сервис с проверенной стойкостью дешевле страхуется репутационно, легче проходит проверки заказчиков при поставках и не создаёт сюрпризов после масштабирования. Найти слабость красной командой — расходы; находить её заголовками новостей — ущерб.
Что получает заказчик
По итогам цикла у организации появляются: карта реальных точек компрометации с приоритетами; доказательная база для инвестиций в защиту — не абстрактные риски, а воспроизведённые сценарии; регрессионный корпус атак, который остаётся и делает следующие проверки строже; и понятный план: что закрыть немедленно, что в квартал, что принять как остаточный риск. Это и есть продукт дисциплины — не бумага, а изменение стойкости системы.
Как понять, что практика прижилась
Зрелость ИИ-RED в организации видна по четырём наблюдаемым признакам. Первый: у каждого ИИ-сервиса известен владелец и дата последней проверки — как у серверов известны патчи. Второй: находки красной команды живут в общем трекере разработки со сроками и исполнителями, а не в презентациях для руководства. Третий: релиз новых функций ИИ-контура без прогона регрессионного корпуса воспринимается командой как нарушение, а не как экономия времени. Четвёртый: после инцидентов во внешнем мире команда спрашивает себя «пройдёт ли это у нас» — и проверяет, а не рассуждает. Пока эти признаки не появились, практика остаётся услугой, купленной один раз; с ними она становится свойством инженерной культуры, которое не теряется при смене подрядчиков и людей.
Как проходит типовой цикл: восемь шагов
Шаг 1 — рамка. Фиксируются объекты (ассистент, агент, поиск по базе), окна времени, канал связи и стоп-условия: что красная команда не трогает, при каких находках работу останавливают немедленно. Шаг 2 — съём отпечатка: перечень эндпоинтов, версий моделей, прав и интеграций; без этой карты атаковать нечего. Шаг 3 — выбор сценариев ущерба: не «попробуем всё», а три-пять конкретных цепочек — что для бизнеса катастрофа. Шаг 4 — атаки. Типовая тройка: косвенная инъекция через документ в базе знаний; уговор агента вызвать инструмент за пределами сценария; переполнение контекста служебным шумом с последующей подменой поведения. Каждая попытка журналируется: ввод, реакция, глубина проникновения. Шаг 5 — находка оформляется как воспроизведённый сценарий: шаги, скриншоты, метки времени, оценка ущерба и классификация по OWASP LLM Top-10. Шаг 6 — отчёт с приоритетами: что закрыть до пятницы, что в квартал, что принять осознанно. Шаг 7 — устранение заказчиком. Шаг 8 — ретест: подтверждение, что векторы закрыты, и включение атак в регрессионный корпус. Цикл без ретеста — половина работы: отчёт устаревает вместе с первым же релизом.
Сводная таблица «вектор проверки → признак пролома → что подтверждает красная команда»
| Вектор проверки | Признак пролома | Что подтверждается |
|---|---|---|
| Инструкция в поле чата | ответ раскрывает правила или чужие данные | работоспособность рамок недоверенного ввода |
| Закладка в документе базы знаний | воспроизводимое изменение поведения по теме | карантин и санитизация пополнений индекса |
| Уговор агента на лишний вызов | инструмент сработал вне сценария | матрица полномочий и подтверждения человеком |
| Переполнение контекста | «утонувшие» правила, странные длинные ответы | лимиты ввода и приоритет инструкций сервиса |
| Выманивание системного промпта | в выдаче — служебный текст дословно | отсутствие секретов в промпте, фильтры вывода |
| Вредоносная разметка в ответе | ссылка или HTML доходит до исполняющей стороны | экранирование вывода в интеграциях |
| Опрос прав через поиск | выдача содержит закрытые для пользователя фрагменты | фильтрация доступа в самом запросе к индексу |
Чек-лист готовности к первому циклу: двенадцать пунктов
- Составлен перечень ИИ-сервисов с владельцами — красная команда атакует список, а не догадки.
- Определены сценарии ущерба, признаваемые бизнесом катастрофическими.
- Согласован контур проверки: тестовый стенд или прод с ограничениями — и это записано.
- Журналирование запросов и ответов включено до начала атак.
- У цикла есть куратор со стороны заказчика с полномочиями останавливать работу.
- Прописаны стоп-условия и канал экстренной связи.
- Правовая рамка закрыта: NDA, границы работы с данными, порядок работы с реальными сведениями.
- Сделаны резервные копии всего, до чего может дотянуться команда.
- Определены метрики успеха: доля воспроизведённых сценариев, глубина проникновения, время детекта.
- Заранее известно, куда попадают находки: трекер, сроки, ответственные.
- Запланирован ретест — без него цикл не считается завершённым.
- Решено, кто прогоняет регрессионный корпус между циклами и по каким триггерам.
Экономика цикла: как ложится на бюджет
Обезличенный расчёт для организации с двумя-тремя ИИ-сервисами. Внешний цикл с инструментальной поддержкой — от 300 000 ₽ (наш тариф на AI Red Teaming); рынок таких работ в России растёт: по оценке TAdviser, сегмент AI Security прошёл отметку 0,5–2,5 млрд ₽ в 2025 году с прогнозом 3–4 млрд ₽ на 2026-й. Внутренняя часть бюджета — время: куратор и один-два инженера на сопровождение и устранение; именно эта строка чаще всего недооценивается. На стороне «доходов» — предотвращённые сценарии: утечка персональных данных на 10–100 тысяч субъектов оценивается штрафом 5–10 млн ₽ (ч. 13 ст. 13.11 КоАП), а воспроизведённая красной командой цепочка — это аргумент в бюджете, который руководство принимает без длинных объяснений. Практичная связка для старта: инвентаризация и аудит контура (от 70 000 ₽) → устранение явного → первый цикл ИИ-RED → регресс между циклами силами команды.
Соседние материалы и первоисточник
- техника работы с инфраструктурой — пентест ИИ-систем;
- мировая практика — AI red teaming: мировой опыт;
- самопроверка до приглашения команды — тест зрелости защиты ИИ;
- методические базы красных команд — OWASP GenAI Security Project.