Чем агент опаснее чат-бота
Чат-бот говорит — агент делает. У него есть инструменты: доступ к базам, почте, календарю, платёжным и кадровым системам. Ошибка или подсказанная злоумышленником команда превращается не в странный ответ, а в реальное действие. Поэтому проверка агента — это в первую очередь аудит полномочий, и лишь потом качество ответов. Общие риски агентных контуров разобраны в материале «Безопасность агентных систем».
Чек-лист из семи пунктов
- Минимальные полномочия. Агенту выданы только те доступы, без которых задача невозможна. Проверьте: сможет ли он, скомпрометированный, навредить?
- Белый список инструментов. Вызов любого внешнего сервиса — явно разрешён; всё прочее запрещено по умолчанию. Сюда же — проверка ограничения полномочий агентов: отдельные креды вместо общих административных.
- Подтверждение человеком. Опасные операции — платежи, смена статусов, массовые рассылки, удаление — требуют нажатия человека. Автоматически выполняется только обратимое.
- Аварийная остановка. Кнопка остановки агента доступна, работает за секунды и не требует разработчика. Персонал знает, где она.
- Лимиты. Ограничены частота действий, расходы на API, число операций за смену. Аномалия — сигнал атаки, а не только сбоя.
- Логирование. Каждое действие агента записывается: запрос, решение, вызванный инструмент, результат. Без журнала инцидент не расследовать.
- Тесты на инъекции. Прогоны сценариев «выполни за пользователя», попытки вызвать запретный инструмент, подсказки в документах и письмах.
- Страхующий лимит. Потолок суммы и числа операций за период — даже при обходе всех фильтров ущерб ограничен физически.
Как проводить тестирование
Тесты выполняются на стенде — копии рабочего контура с тестовыми доступами. Набор сценариев: прямые просьбы совершить запретное; инструкции, спрятанные в содержимом, которое агент читает; попытки «договориться» с агентом о повышении прав; обход через цепочку безобидных шагов. Фиксируется не только успех атаки, но и путь: какой фильтр должен был сработать и почему не сработал.
Типовые находки
Проверки агентных контуров подсказывают, где дыры встречаются чаще. Агент умеет отправлять письма «от имени» общего ящика — и делает это по первой просьбе. Токен внешнего сервиса зашит в код, а не в хранилище секретов. Подтверждение человеком устроено как вопрос «подтвердить? да/нет» — и агент добивается согласия повторной просьбой. Лимитов нет, поэтому зацикленный агент за ночь отправляет тысячу писем.
Каждая из этих находок закрывается часами настройки — если её нашли до запуска. После запуска та же находка стоит инцидента, разбора и объяснений. Разница в порядке действий, а не в сложности исправления.
Когда перепроверять
Проверка агента — не разовое событие. Триггеры повторного прогона: смена версии модели, новый инструмент в белом списке, расширение прав, жалобы пользователей на странные действия, изменения в интеграции. Плановый минимум — раз в квартал. Журнал действий агента просматривается чаще: аномалии в нём означают, что сценарии использования ушли вперёд правил.
Отдельный класс проверок — поведение при недоступности инструментов: что делает агент, если CRM не отвечает — ждёт, молчит или «изобретает» ответ. Корректная реакция — честное сообщение об ошибке и передача человеку, и её тоже проверяют сценарием. Прогоняйте сценарии и после обновлений смежных систем: интеграции меняют поверхность атаки незаметно.
Критерии готовности к запуску
Агента выпускают в работу, когда: критичные сценарии инъекций закрыты; дежурная смена потренирована нажимать кнопку остановки в неудобный час; опасные операции — только через человека; остановка протестирована; журнал ведётся; лимиты выставлены. Для чувствительных контуров (персональные данные, деньги, госзаказ) добавляется внешний аудит по OWASP LLM Top-10 — он стоит от 150 000 ₽ за 1–2 недели, либо полноценное red teaming — от 300 000 ₽ у ООО «НЬЮ-ССТ» (new-sst.ru), сентябрь 2026.
Разница с проверкой обычной системы — в акценте: у бота смотрят ответы и защиту данных, у агента — прежде всего права и поведение при попытках ими злоупотребить. Методика проверки ИИ-систем в целом — в ответе на вопрос «Как проверить ИИ-систему на безопасность».