Когда внутренний прогон, а когда внешняя команда
Термин «красная команда» для ИИ означает управляемую атаку на собственную систему: люди играют против защиты, чтобы найти дыры раньше реальных злоумышленников. Сам термин и происхождение подхода разобраны в словарной статье «Красная команда ИИ». Внутренний мини-прогон уместен после каждого изменения: сменилась модель, промпт, база знаний — час сценариев подтверждает, что защита не ослабла. Внешняя команда нужна раз в год и перед крупными запусками: свежий взгляд без привычки к собственной логике.
Подготовка: стенд и правила
Тест идёт на отдельном стенде с обезличенной копией контура и тестовыми доступами — атаковать живую систему с реальными данными нельзя: вы сами устроите себе инцидент. Фиксируются правила: время окна, запрет на действия с необратимыми последствиями, порядок экстренной остановки. Роли: атакующие, наблюдатель за журналами, общий координатор процесса. Заранее согласуйте фиксацию времени: длительность каждой атаки и суммарное окно пригодятся для сравнения прогонов между собой. Само окно выбирайте на тихий час: параллельные эксперименты разработчиков смазывают картину. Заранее готовится шаблон фиксации находки: запрос, ответ, путь обхода, оценка критичности, имя тестировщика.
Набор сценариев
- Джейлбрейки: ролевые легенды, «переводы», разбиение запретного на шаги — попытка вывести модель за рамки роли.
- Промпт-инъекции: инструкции, спрятанные в документах базы знаний, письмах, пользовательских данных.
- Вывод системного промпта: прямые и косвенные попытки узнать правила и настройки.
- Превышение полномочий: уговоры агента выполнить запретное действие или вызвать неразрешённый инструмент.
- Выуживание данных: вопросы о персональных данных и содержимом, к которому у спрашивающего нет прав.
- Злоупотребление ресурсами: массовые запросы, переборы, попытки выкачать базу ответами.
Список не догма: против конкретной системы находятся свои тропы — попытка «договориться» с голосовым ассистентом, обход через файлы редкого формата, вопросы на грани темы. Свежие тропы добавляются в набор после каждого прогона.
Отличия красной команды от классического пентеста — в объекте атаки: не серверы и сети, а поведение модели; сравнение подходов — в статье «ИИ red teaming против пентеста».
Фиксация и отчёт
Каждая находка записывается так, чтобы её мог повторить другой человек: точный запрос, ответ системы, какое правило должно было сработать. Критичность оценивается по последствиям: утечка персональных данных выше, чем обход стилистики. Итог отчёта — список с приоритетами исправлений; после патчей ключевые сценарии повторяются, и набор пополняется новыми находками как регресс-тестами. Так тест из разового мероприятия превращается в растущую библиотеку иммунитета.
Готовая находка выглядит так: сценарий одним абзацем, шаги воспроизведения по кнопкам и запросам, снимок ответа, оценка критичности и предлагаемое исправление. Хорошая находка читается за минуту и не требует пояснений автора. Команда, пишущая находки в таком формате, через квартал получает библиотеку, по которой новый сотрудник изучает реальные риски системы — живее любого тренинга.
Внешнее ИИ red teaming с ручными атаками под конкретный контур — от 300 000 ₽, аудит ИИ-систем по перечню OWASP LLM Top-10 — от 150 000 ₽ у ООО «НЬЮ-ССТ» (new-sst.ru), сентябрь 2026.
Где брать сценарии
Первый источник — перечни OWASP LLM Top-10: каждый пункт разворачивается в десяток конкретных атак. Второй — ваша линия поддержки: на какие «странные вопросы» жаловались пользователи, что система отвечала не так. Третий — чужие инциденты из публичных разборов: обходы, найденные у других, проверяются у себя в первую очередь. Четвёртый — свободная фантазия команды в формате «а что, если»: свежие головы без загрузки контекстом дают неожиданные траектории.
Частота прогонов
Базовый ритм — после каждого изменения в контуре и не реже раза в квартал. Обязательные внеочередные поводы: смена версии модели, крупное пополнение базы знаний, расширение полномочий агента, выход на новую аудиторию. Прогон перед масштабированием дешевле разбора инцидента после него.
Проверку отдельного агента перед запуском дополняет чек-лист «Как проверить ИИ-агента на безопасность».