Guardrails — это ограждения, которые не дают языковой модели выйти за рамки сценария: раскрыть лишнее, выполнить чужую команду, отправить данные не туда. Методическая база — OWASP LLM Top-10; защита строится слоями, и один фильтр «на всякий случай» не работает. Порядок настройки — восемь шагов.
Настройка не требует собственного ИИ-отдела: это дисциплина процессов плюс типовые фильтры, которые внедряет ваш подрядчик. Ориентир по стоимости проверки: аудит ИИ-систем с регламентом LLM — от 150 000 ₽ за 1–2 недели, ИИ red teaming — от 300 000 ₽ (прайс НЬЮ-ССТ, сентябрь 2026). Базовый набор ограждений ниже — минимум для любой внешней системы на LLM: корпоративного помощника, бота на сайте или агента в мессенджере.
Пошаговый план
Проведите инвентаризацию рисков
Пройдите по чек-листу OWASP LLM Top-10 и выпишите, какие риски применимы к вашей системе: промпт-инъекции, утечка данных из базы знаний, чрезмерные полномочия агента, галлюцинации. Список рисков определяет состав фильтров — не наоборот. Ранжируйте риски по ущербу: недоступный ответ дешевле утечки данных.
Отфильтруйте входные данные
Настройте фильтрацию запросов пользователя: выявление инструкций, пытающихся перехватить роль системы («игнорируй предыдущие указания»), маскировку служебных маркеров и попытки извлечь системный промпт. Фильтр входа — первый барьер, но никогда единственный. Фильтр входа тестируйте на перефразированных атаках, а не только на буквальных.
Ограничьте темы и формат выхода
Задайте ассистенту допустимые темы и явный сценарий отказа: «этот вопрос вне моей темы, переадресую специалисту». Фильтр выхода проверяет ответ на персональные данные, секреты и обещания, которых нет в базе знаний. Природа галлюцинаций и приёмы защиты разобраны в материале почему LLM галлюцинирует. Список допустимых тем согласуйте с владельцем процесса — он знает нюансы.
Разграничьте доступ к базе знаний
Проверьте, что ассистент отдаёт пользователю только то, что тому разрешено видеть. База знаний разбивается на сегменты по ролям: у сотрудника отдела кадров и у рядового пользователя — разные фрагменты. Это же требование всплывает при аудите ИИ-систем. Сегменты базы знаний сверьте с ролями в учётной системе один к одному.
Ограничьте полномочия ИИ-агентов
Если ассистент выполняет действия (создаёт задачи, меняет записи), выдайте ему минимальные права и запретите критичные операции без подтверждения человеком. Классическая ошибка — агент с административными правами «на всякий случай». Критичные действия агента выводите на подтверждение с описанием последствий.
Включите журналирование
Логируйте запросы, сработавшие фильтры, действия агентов и эскалации. Журнал нужен не «для галочки»: по нему расследуют инциденты и находят слабые места ограждений. Сколько хранить логи и как их защитить — отдельный пункт регламента. Журнал защищайте как конфиденциальные данные: он сам источник метаданных.
Оставьте человека в контуре
Для критичных сценариев настройте подтверждение человеком: черновик ответа отправляет ИИ, отправляет сотрудник. Это снижает риски репутационного и юридического характера — зачем нужен человек в контуре, разобрано в соответствующем ответе. Порог обязательного подтверждения человеком задайте по сумме риска операции.
Пересматривайте ограждения регулярно
Guardrails — не разовая настройка: после каждого расширения базы знаний, нового сценария или инцидента прогоняйте проверку заново. Независимая проверка живой системы — ИИ red teaming от 300 000 ₽, аудит ИИ-систем с регламентом LLM — от 150 000 ₽ за 1–2 недели (прайс НЬЮ-ССТ, сентябрь 2026). Каждое изменение ограждений документируйте — при аудите это ваш главный аргумент.
Частые ошибки
Ограждения чаще всего ломают не хакеры, а перечисленные организационные ошибки — проверьте свой контур по списку до запуска.
- Один «волшебный фильтр». одиночный фильтр входа обходится перефразированием; работает только эшелонированная защита
- Ограждения без журнала. вы не узнаете об обходе, пока не получите последствий; журналирование — обязательная часть контура
- Права агента «на вырост». выданные «по максимуму» полномочия превращают ошибку модели в инцидент с реальным ущербом
- Настройка «навсегда». база знаний и сценарии меняются, а ограждения — нет; пересмотр после изменений обязателен
Инструменты и сроки
Для прохождения плана достаточно перечисленных инструментов; ориентир по времени — ориентир — до 10 рабочих дней на первый контур ограждений. Начните с трёх самых критичных рисков из вашего списка: полный контур ограждений строится итерациями, а не за один проект.
- Чек-лист OWASP LLM Top-10
- Фильтр промпт-инъекций
- Журнал событий LLM
Что получится в итоге
Готовый контур guardrails — это предсказуемая система: ассистент отказывается от вопросов вне темы, не раскрывает закрытые данные, его действия ограничены и расписаны в журнале. Для заказчика это перевод разговоров о «рисках нейросетей» в конкретный чек-лист, который проверяется на аудите. Такой же контур становится фундаментом готовности к 243-ФЗ: учтённые риски, регламенты и журналы уже существуют и не требуют отдельного проекта «для закона».