Определение простыми словами
Safety filtering — это автоматический контроль того, что модель получает на вход и отдаёт на выход, по заранее заданным правилам безопасности. Сама модель продолжает делать то, что умеет, — но вокруг неё стоят два часовых: первый проверяет запрос до генерации, второй — ответ после. В корпоративном контуре фильтры настраиваются под политику компании, а не под общие правила публичных сервисов. Отдельный плюс своего слоя — управляемость: правила компании меняются за часы, а правила платформы — без вас и в любой момент.
Входной контур
Входной фильтр разбирает запрос до модели. Типовые задачи: распознать промпт-инъекцию и попытку джейлбрейка, выявить запретные для домена темы, определить попытку выведать системную инструкцию, отсечь заведомо злоупотребительские паттерны вроде словарного перебора. Подозрительный запрос отклоняется, упрощается или помечается для усиленного контроля ответа. Механика инъекций как класса атак разобрана в статье о защите LLM от промпт-инъекций.
Выходной контур
Выходной фильтр проверяет сгенерированный ответ. Корпоративный набор: детекция персональных данных и реквизитов, контроль выхода за рамки темы и роли, блокировка опасных рекомендаций (право, медицина, финансы — без оговорок и дисклеймеров), проверка опоры на найденные источники. Технически это комбинация классификаторов, регулярных выражений и правил: например, «в ответе клиенту запрещены номера договоров и паспортные данные» — одно такое правило закрывает большинство случайных утечек в клиентском канале. Риски неконтролируемого вывода систематизированы в пункте OWASP LLM05 о небезопасном выводе.
Баланс строгости
Главная настройка — не «включить или выключить», а степень строгости. Фильтр, который блокирует десять процентов легитимных вопросов, ломает пользу системы: пользователи уходят в обходы, а с ними — контроль. Рабочие метрики — доля ложных срабатываний на тестовом наборе реальных вопросов и доля пропущенных нарушений. Их меряют при внедрении, после каждого изменения правил и перед расширением тематики системы.
Практический ориентир: если из ста нормальных вопросов фильтр отклоняет больше пяти, сотрудники начнут обходить систему или переформулировать вопросы до неузнаваемости — и смысловая нагрузка фильтрации упадёт. Гнаться за нулём ложных срабатываний тоже нельзя: это означает дыры для реальных атак. Здоровый диапазон подбирается под цену ошибки конкретного домена и документируется: через полгода будет важно, почему выбран именно он.
Где фильтры живут
Размещение — перед моделью и после неё, как отдельный сервис, а не внутри промпта: инструкции в промпте злоумышленник обходит уговором, отдельный фильтр — только обходом самой системы. Решения фильтров журналируются: что заблокировано и почему — это материал для настройки и доказательная база при инцидентах. На практике оба контура настраиваются итерациями: первая версия правил пишется по списку очевидных запретов, затем на живом трафике отслеживаются ложные срабатывания и пропуски, правила уточняются. Полезно вести каталог решений с пометками «оставить — поправить»: через месяц он превращается в точную карту того, что считать нарушением именно в вашем домене. Настройка входных и выходных фильтров под домен входит в аудит ИИ-систем ООО «НЬЮ-ССТ» (new-sst.ru) — от 150 000 ₽ за 1–2 недели; сопровождение контура с периодической перенастройкой — от 60 000 ₽/мес (сентябрь 2026).
Ошибки внедрения
Первая и частая — фильтр в системном промпте вместо отдельного слоя: инструкцию уговорами обходят, внешний фильтр — нет. Вторая — избыточная строгость без замера ложных срабатываний: система «безопасна», потому что почти ничего не отвечает. Третья — фильтры без журнала решений: непонятно, что и почему блокировалось, настраивать не на что. Четвёртая — набор правил скопирован из чужого домена: медицина и логистика запрещают разное.
Правильный цикл: измерить — настроить — измерить снова. И повторять после каждой смены модели, потому что новое поколение моделей иначе реагирует на одни и те же формулировки правил.
Смежная тема — контроль фактической точности ответов — раскрыта в ответе «Что такое галлюцинации LLM и как их обезопасить».