Guardrails — ограждения вокруг языковой модели: программные проверки ввода и вывода, которые не дают системе выйти за рамки дозволенного. Если модель — талантливый, но буквальный исполнитель, то guardrails — регламент, инспектор и стоп-кран в одном слое. Отдельная просьба в промпте «веди себя прилично» — не guardrails: ограждения работают кодом, а не пожеланиями.
Что проверяют
- Ввод: промпт-инъекции, запретные темы, попытки выудить системные инструкции и персональные данные.
- Вывод: утечки персональных данных, токсичность, раскрытие системного промпта, конфиденциальные сведения из базы знаний.
- Формат: соответствие схеме ответа — валидный JSON, обязательные поля, диапазоны значений.
- Действия: согласование вызовов инструментов с политикой полномочий, подтверждение необратимых операций человеком.
Отдельный контур — работа с внешним контентом: документы, веб-страницы и письма, попадающие в контекст через RAG или агентов. Для них проверка двойная: не несёт ли фрагмент инструкций для модели и не содержит ли данных, которые нельзя показывать этому пользователю. Обе проверки выполняются до попадания текста в контекст.
Уровни защиты
Зрелый контур выстраивает эшелон: фильтры до модели, проверки после, ограничение прав на инструменты, логирование всего потока. Классификация угроз OWASP LLM Top-10 — рабочая карта для этого: инъекции, утечки, избыточные полномочия, уязвимости цепочки поставки — по каждой позиции строится своя проверка, обзор — OWASP LLM Top-10. Про главный вектор атак — промпт-инъекции. Производственный вопрос — что делать с отказом: молча заблокированный ввод выглядит для пользователя как «бот сломался». Зрелые контуры всегда отвечают пояснением и маршрутом — «такой запрос не обслуживается, вот кто поможет», иначе защита превращается в новую категорию обращений в поддержку.
Важный принцип: guardrails не заменяют, а дополняют архитектурные меры. Права доступа, изоляция контента, минимальные полномочия инструментов работают всегда; фильтры — вероятностны и проверяемы на обход. Поэтому зрелость контура измеряется тестами на устойчивость — методика в материале тест устойчивости LLM к инъекциям, а полевые атаки отрабатывает ИИ red teaming.
Зачем бизнесу
- Штрафная безопасность. Утечки через ИИ-сервисы — штрафы по 420-ФЗ от 3 до 20 млн ₽ и оборотные санкции; блокировка утечки на выводе — прямая экономия.
- Репутация. Публичный бот, которого «перевоспитывают» скриншотами, теряет доверие быстрее, чем набирает.
- Интеграции. Валидация формата ответа защищает связанные системы от «творчества» модели.
Валидация формата
Самый недооценённый вид ограждений — форматная валидация: проверка, что ответ — валидный JSON нужной схемы, что числа в допустимых диапазонах, что обязательные поля заполнены. Именно она защищает интеграции: сломанный ответ обрабатывается автоматически — повтором запроса или эскалацией, а не падением системы, стоящей за моделью. Доля таких отказов измеряется, и её снижение — честная метрика зрелости.
Цены «от» (сентябрь 2026)
Аудит ИИ-систем по OWASP LLM Top-10 — от 150 000 ₽ за 1–2 недели; ИИ red teaming — от 300 000 ₽; полный пакет защиты ИИ — от 400 000 ₽; сопровождение — от 60 000 ₽/мес. Цены сентября 2026, без НДС (УСН).
С чего начать
Выпишите три сценария ущерба: какие данные модель может выделить, какие действия выполнить, что ответить не имеет права. Под каждый сценарий — проверка на входе или выходе и запись в журнал. Уже этот минимум закрывает большинство инцидентов первого года эксплуатации. Через месяц вернитесь к журналу: какие проверки срабатывают, какие темы живут в отказах, что разбирается вручную — на живых данных матрица ограждений дорабатывается точечно.