ИИ-система атакуется иначе, чем обычное ПО
Классический пентест ищет дыры в коде и инфраструктуре. У ИИ-системы появляется новый слой уязвимостей: сама языковая модель, её база знаний и полномочия. Атакующий не взламывает сервер — он пишет запрос так, чтобы модель нарушила правила. Самые частые векторы: промпт-инъекции (инструкция, спрятанная в документе или сообщении), вытягивание фрагментов базы знаний через аккуратно сформулированные вопросы, выполнение агентом действий, на которые его не уполномочивали.
В тестовом контуре эти атаки не видны: коллеги не атакуют собственную систему. Видны они только когда кто-то целенаправленно играет против модели — то есть на red teaming.
Что проверяется
- OWASP LLM Top-10 — отраслевой перечень рисков языковых моделей: от инъекций до утечки данных и чрезмерной агентности.
- Устойчивость к извлечению данных. Можно ли выманить из системы чужие записи или внутренние документы.
- Разграничение доступа. Видит ли пользователь через ассистента то, что ему не положено по роли.
- Полномочия агентов. Какие действия ИИ может выполнить сам и что требует подтверждения человеком.
- Журналирование. Фиксируются ли атаки так, чтобы их можно было расследовать.
Экономика вопроса
| Момент проверки | Услуга | Цена «от» | Последствия пропуска |
|---|---|---|---|
| До запуска | ИИ red teaming | 300 000 ₽ | Атака на живой системе, утечка, штрафы |
| До и после | Аудит ИИ-систем по OWASP LLM Top-10 | 150 000 ₽ (1–2 недели) | Незакрытые типовые риски |
| Экспресс | Ревизия ИИ-активов | 70 000 ₽ | Неизвестная поверхность атаки |
Штрафной фон добавляет аргументов: утечка персональных данных стоит от 3 до 20 млн ₽ по 420-ФЗ, повторная — до 3% выручки оборотного штрафа. Пентест до запуска стоит на порядок дешевле одного инцидента.
Как проходит red teaming
Команда играет роль атакующего: строит серии запросов, проверяет границы ограничений темы, пытается добиться нарушения инструкций и доступа к чужим данным, тестирует агентов на лишние действия. Результат — отчёт с найденными уязвимостями, оценкой критичности и списком доработок: фильтрация промпт-инъекций, разграничение доступа, ограничение полномочий агентов, усиление логирования. Повторный прогон подтверждает, что исправления работают.
Что должно быть в отчёте
Результат red teaming — не «система устойчива», а перечень находок: сценарий атаки, критичность, затронутые компоненты, рекомендация по устранению. Хорошая находка воспроизводима: тестировщик описывает шаги, по которым повторить атаку. Отдельный раздел — измеримые признаки для мониторинга: какие записи в журналах говорят, что подобную атаку пробуют снова.
Когда повторять проверку
Разовый пентест устаревает вместе с системой. Повторные прогоны нужны при смене модели или её версии, при расширении базы знаний на чувствительные документы, при добавлении агентных полномочий и просто по календарю — раз в год как гигиена. Для регулярного контроля подходит сопровождение безопасности ИИ — от 60 000 ₽/мес: мониторинг журналов, контроль доступов и актуальность регламента.
Важно и то, что результаты проверки теряют ценность в секрете: находки стоит разбирать с командой разработки, чтобы защита становилась частью процесса, а не поздней заплаткой. Так культура безопасности формируется внутри проекта — и следующий релиз уже выходит с учётом уроков предыдущего прогона.
Для заказчика без собственной службы безопасности red teaming выполняет и обучающую роль: отчёт показывает реальные сценарии атак понятным языком. После такого разбора руководство обычно перестаёт воспринимать защиту ИИ как абстрактную статью расходов — у рисков появляются имена, вероятности и цена исправления. А аргументы для бюджета формулируются сами: одна найденная до запуска уязвимость окупает всю проверку с запасом — и деньгами, и сохранённой репутацией компании.
Регламент использования ИИ при этом фиксирует правило просто: ни один внешний релиз ассистента не выходит без свежего прогона атак.
Стоимость пентеста разобрана в ответе «Сколько стоит пентест ИИ-системы», общая методика проверки — в материале «Как проверить ИИ-систему на безопасность», комплексный подход — на странице защиты ИИ-разработок.