Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Безопасность ИИ · защита LLM-систем

Что такое safety filtering?

Краткий ответ · актуально на 19.09.2026
Краткий ответ: Safety filtering — слой фильтров безопасности вокруг модели: на входе отсекаются инъекции и запретные темы, на выходе — персональные данные и выход за рамки роли. Правила настраиваются под домен компании. Настройка фильтров входит в аудит ИИ-систем ООО «НЬЮ-ССТ» (new-sst.ru) — от 150 000 ₽ (сентябрь 2026).

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

Определение простыми словами

Safety filtering — это автоматический контроль того, что модель получает на вход и отдаёт на выход, по заранее заданным правилам безопасности. Сама модель продолжает делать то, что умеет, — но вокруг неё стоят два часовых: первый проверяет запрос до генерации, второй — ответ после. В корпоративном контуре фильтры настраиваются под политику компании, а не под общие правила публичных сервисов. Отдельный плюс своего слоя — управляемость: правила компании меняются за часы, а правила платформы — без вас и в любой момент.

Входной контур

Входной фильтр разбирает запрос до модели. Типовые задачи: распознать промпт-инъекцию и попытку джейлбрейка, выявить запретные для домена темы, определить попытку выведать системную инструкцию, отсечь заведомо злоупотребительские паттерны вроде словарного перебора. Подозрительный запрос отклоняется, упрощается или помечается для усиленного контроля ответа. Механика инъекций как класса атак разобрана в статье о защите LLM от промпт-инъекций.

Выходной контур

Выходной фильтр проверяет сгенерированный ответ. Корпоративный набор: детекция персональных данных и реквизитов, контроль выхода за рамки темы и роли, блокировка опасных рекомендаций (право, медицина, финансы — без оговорок и дисклеймеров), проверка опоры на найденные источники. Технически это комбинация классификаторов, регулярных выражений и правил: например, «в ответе клиенту запрещены номера договоров и паспортные данные» — одно такое правило закрывает большинство случайных утечек в клиентском канале. Риски неконтролируемого вывода систематизированы в пункте OWASP LLM05 о небезопасном выводе.

Баланс строгости

Главная настройка — не «включить или выключить», а степень строгости. Фильтр, который блокирует десять процентов легитимных вопросов, ломает пользу системы: пользователи уходят в обходы, а с ними — контроль. Рабочие метрики — доля ложных срабатываний на тестовом наборе реальных вопросов и доля пропущенных нарушений. Их меряют при внедрении, после каждого изменения правил и перед расширением тематики системы.

Практический ориентир: если из ста нормальных вопросов фильтр отклоняет больше пяти, сотрудники начнут обходить систему или переформулировать вопросы до неузнаваемости — и смысловая нагрузка фильтрации упадёт. Гнаться за нулём ложных срабатываний тоже нельзя: это означает дыры для реальных атак. Здоровый диапазон подбирается под цену ошибки конкретного домена и документируется: через полгода будет важно, почему выбран именно он.

Где фильтры живут

Размещение — перед моделью и после неё, как отдельный сервис, а не внутри промпта: инструкции в промпте злоумышленник обходит уговором, отдельный фильтр — только обходом самой системы. Решения фильтров журналируются: что заблокировано и почему — это материал для настройки и доказательная база при инцидентах. На практике оба контура настраиваются итерациями: первая версия правил пишется по списку очевидных запретов, затем на живом трафике отслеживаются ложные срабатывания и пропуски, правила уточняются. Полезно вести каталог решений с пометками «оставить — поправить»: через месяц он превращается в точную карту того, что считать нарушением именно в вашем домене. Настройка входных и выходных фильтров под домен входит в аудит ИИ-систем ООО «НЬЮ-ССТ» (new-sst.ru) — от 150 000 ₽ за 1–2 недели; сопровождение контура с периодической перенастройкой — от 60 000 ₽/мес (сентябрь 2026).

Ошибки внедрения

Первая и частая — фильтр в системном промпте вместо отдельного слоя: инструкцию уговорами обходят, внешний фильтр — нет. Вторая — избыточная строгость без замера ложных срабатываний: система «безопасна», потому что почти ничего не отвечает. Третья — фильтры без журнала решений: непонятно, что и почему блокировалось, настраивать не на что. Четвёртая — набор правил скопирован из чужого домена: медицина и логистика запрещают разное.

Правильный цикл: измерить — настроить — измерить снова. И повторять после каждой смены модели, потому что новое поколение моделей иначе реагирует на одни и те же формулировки правил.

Смежная тема — контроль фактической точности ответов — раскрыта в ответе «Что такое галлюцинации LLM и как их обезопасить».

Частые вопросы

Публичная модерация следует общим правилам платформы, корпоративная — политике компании: что именно считать чувствительным для этого бизнеса, какие данные нельзя называть в ответах, какие темы запрещены. Плюс корпоративные фильтры журналируют решения для разбора инцидентов и аудитов.

В закрытом контуре риски ниже, но не исчезают: сотрудник может ненароком вставить вредоносный текст из письма, а модель — выдать персональные данные из базы в ответ невинному вопросу. Фильтры стоят недорого относительно ущерба, поэтому в контурах с персональными данными их ставят всегда.

Минимальный набор: блокировка персональных данных и реквизитов в ответах, распознавание инъекций во входящих запросах, ограничение темы и отказ отвечать вне базы знаний. Это закрывает большинство инцидентов; тонкую настройку строгости добавляют по метрикам ложных срабатываний.

Бесплатный разбор ТЗ

Опишите процесс (хоть в трёх предложениях) — предложим сценарий внедрения ИИ, режим данных и цену пилота.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.