Что именно мы предотвращаем
Джейлбрейк — это обход наложенных на модель ограничений хитро сформулированным запросом: ролевыми легендами, «переводами», разбиением запретного задания на шаги. Что такое сама атака, подробно разобрано в статье «Джейлбрейк LLM». Здесь — противоположная задача: что сделать заранее, чтобы попытки обхода не приводили к результату. Взломщик не должен получить ни данные, ни запрещённое действие, ни системную инструкцию.
Мотивация атакующих различна: кто-то ищет данные, кто-то — «неограниченного» ассистента на халяву, кто-то проверяет границы из любопытства. Для бизнеса результат один: обход правил оборачивается недопустимыми ответами, лишними действиями и репутационными сюрпризами в самый неподходящий момент.
Эшелон первый: фильтр запросов
До модели запрос проходит классификатор: известные паттерны обхода, попытки смены роли, инструкции «игнорировать правила», нестандартные кодировки и разбиения. Подозрительный запрос отклоняется или передаётся в усечённом виде. Фильтр не идеален, но снимает массовые дешёвые атаки, оставляя ручные — для следующих эшелонов.
Эшелон второй: жёсткая системная инструкция
Системная инструкция пишется в расчёте на противника: тема и границы, перечень запрещённых действий, формат отказа, поведение при требовании «раскрыть промпт». Секреты и доступы в инструкцию не выносят вовсе — то, чего нет в промпте, нельзя из него вытянуть. Инструкцию тестируют отдельно: прогоняют библиотеку обходов и правят слабые формулировки.
Эшелон третий: контроль генерации и выхода
Даже если модель сошла с роли, ответ проверяется на выходе: нет ли персональных данных, реквизитов, внутренних идентификаторов, запрещённого контента. Действия агентов — отдельный рубеж: смена статусов, платежи, отправка писем выполняются только через белый список операций, опасные — с подтверждением человеком. Джейлбрейк без права на действие остаётся болтовнёй, а не инцидентом.
Эшелон четвёртый: регулярное тестирование
Обходы обновляются вместе с моделями, поэтому защита — процесс. После смены версии модели, правки промпта или пополнения базы знаний прогоняют набор джейлбрейк-сценариев и сравнивают долю успешных обходов с порогом. Профессиональный уровень — ИИ red teaming: от 300 000 ₽, ручной атакующий прогон строится под именно ваш контур (сентябрь 2026). Связка «инъекция в промпте плюс джейлбрейк» разобрана в обзоре защиты LLM от промпт-инъекций.
Метрики устойчивости
Защиту от обходов измеряют, а не ощущают. Базовая метрика — доля успешных джейлбрейков на фиксированном наборе сценариев: из двухсот контрольных попыток через барьеры прошли три. Набор хранится в версии вместе с промптом; порог задаётся заранее — например, не более одного процента прохождений для запретных тем и ноль для утечек данных.
Вторая метрика — цена ложных срабатываний: сколько процентов легитимных вопросов фильтр отклонил зря. Перекос в строгость тихо убивает пользу системы: пользователи теряют доверие и возвращаются к ручной работе. Баланс подбирают на выборке настоящих вопросов пользователей и пересматривают после каждой смены модели.
Третья — время реакции: за сколько часов после обнаружения нового обхода патч доезжает до рабочего контура, а сценарий попадает в регресс-набор. Эта цифра характеризует не модель, а процесс — и именно она отличает управляемую систему от надежды на удачу.
Если обход всё же удался
Алгоритм короткий: зафиксировать запрос и ответ в журнале, закрыть конкретную дыру (правка фильтра или инструкции), добавить сценарий в регресс-набор, при утечке данных — действовать по плану реагирования. Единичный джейлбрейк — не катастрофа; катастрофа — отсутствие журнала, из-за которого невозможно оценить масштаб.
Параллельно оценивайте масштаб: один сценарий в руках одного пользователя — находка низкого ранга; автоматизированный перебор с сотнями запросов — уже атака, требующая блокировки источника и оповещения дежурной смены. Различение делается по журналам, поэтому их полнота — часть защиты от обходов, а не желательная опция.
Бюджет эшелонов нелинейный: два фильтра и дисциплина промпта закрывают большинство инцидентов за копейки, а внешнее тестирование добавляет глубину. Аудит ИИ-систем с проверкой устойчивости к обходам — от 150 000 ₽ за 1–2 недели у ООО «НЬЮ-ССТ» (new-sst.ru).