Термин пришёл из военной практики: «красные» имитируют противника, чтобы найти слабые места до настоящего боя. В ИИ красная команда делает то же с языковыми моделями: инфраструктура может быть безупречной по классическим меркам, а бот — послушно выдавать системный промпт или выполнять чужие инструкции.
Особенность направления — асимметрия усилий: атакующему достаточно одной сработавшей инъекции, защитнику нужно удержать все векторы сразу. Поэтому учения не «сдаются один раз и навсегда»: каждая смена модели, обновление базы знаний или новый инструмент агента открывает дверь заново. Зрелые организации встраивают красную команду в цикл разработки — примерно так же, как когда-то встроили пентест в релизный процесс.
Чем отличается от классического пентеста
Пентест атакует инфраструктуру — сети, серверы, приложения. Красная команда по ИИ атакует поведение модели: промпт-инъекции и джейлбрейки, извлечение системного промпта и данных обучения, обход фильтров контента, атаки на агентов через инструменты, манипуляции с векторными базами RAG. Поэтому ИИ red teaming не заменяет пентест, а дополняет его отдельным контуром проверок.
Как проходят учения
- Правила: фиксируются границы, критичные данные и каналы, «стоп-сигналы».
- Разведка: карта векторов — вводы, документы, веб-контент, инструменты агентов.
- Атаки: тысячи автоматических промптов плюс ручные целевые сценарии.
- Отчёт: сработавшие векторы с примерами и оценкой серьёзности.
- Повтор: после устранения — контрольный прогон, подтверждающий закрытие.
Прозрачность — обязательное условие: заказчик заранее знает сценарии, состав команд и формат отчёта, а все находки остаются внутри организации. Хороший отчёт читается как сюжет: что атаковали, что сработало, к чему это могло привести и что уже исправлено.
Зачем бизнесу
- Запуск в производство: публичный бот или агент проходит учения до встречи с реальными злоумышленниками.
- Доказательство безопасности: отчёт red teaming запрашивают заказчики и страховщики.
- Регуляторная повестка: по 243-ФЗ организации разбираются с рисками ИИ-систем; учения дают фактуру для этого разбора.
- Тренировка защиты: синяя команда и SOC получают реальные сценарии атак для настройки мониторинга.
Для госзаказчиков и компаний с публичными ботами учения стали нормой приёмки: система, не прошедшая красную команду, не выпускается во внешний контур. А для внутренних агентных систем red teaming — единственный способ заранее узнать, что произойдёт, когда злоумышленник пришлёт не вирус, а невинно выглядящий документ с инструкцией внутри.
Что атакуют в первую очередь
- Диалоговые вводы: прямые инъекции и джейлбрейки в чате — попытка снять ограничения и вытащить системный промпт.
- Подгружаемый контент: RAG-база и веб-страницы как канал косвенных команд ассистенту или агенту.
- Инструменты агентов: провокация опасных действий через tool use — записи, письма, изменения прав.
- Векторные хранилища: отравление индекса ложными фрагментами, влияющими на будущие ответы.
- Фильтры вывода: обход ограничений кодированием, многоязычными вставками и пошаговыми «легендами».
Список примерно соответствует карте OWASP LLM Top-10 — по ней удобно сверять покрытие: если какой-то класс угроз в плане учений отсутствует, значит, проверка неполная.
Цены «от» (сентябрь 2026)
ИИ red teaming — от 300 000 ₽; аудит ИИ-систем по OWASP LLM Top-10 — от 150 000 ₽ за 1–2 недели; ревизия ИИ-активов — от 70 000 ₽; сопровождение — от 60 000 ₽/мес. Цены сентября 2026, без НДС (УСН).
С чего начать
Если система уже в работе — начните с аудита по OWASP LLM Top-10: он покажет, где учения дадут максимум. Если контур ещё строится, закладывайте тесты устойчивости сразу — дешевле, чем перестраивать архитектуру после первого инцидента.