Задача: данные в модель — без персональных
Практически каждый корпоративный LLM-сценарий встречает одно и то же препятствие: в запросах и документах, которые нужно обработать моделью, живут персональные данные и коммерческие чувствительные сведения — ФИО клиентов, телефоны, реквизиты, номера договоров, диагнозы, суммы. Отдавать их во внешний API нельзя по 152-ФЗ и внутренним политикам; отказываться от сценария — значит отказаться от автоматизации. Конвейер маскирования решает дилемму: чувствительные элементы распознаются и заменяются типизированными плейсхолдерами до модели, а в ответе модели при необходимости восстанавливаются.
Отдельный класс задачи — «отдать на обработку вообще нельзя»: например, журналы и трейсы, которые собирает LLMOps-мониторинг, или обучающие выборки. Там маскирование применяется в одну сторону, без восстановления. Обе постановки закрываются одним технологическим контуром с разной конфигурацией.
Что распознаём и маскируем
- Персональные данные: ФИО, даты рождения, адреса, телефоны, адреса почты, паспортные данные, СНИЛС, ИНН.
- Платёжные и финансовые: номера карт и счетов, суммы по конкретным клиентам.
- Специальные категории: медицинские сведения, биометрия в текстовом виде — самый строгий режим обработки.
- Коммерчески чувствительные: номера договоров, ценовые условия, внутренние коды — по перечню заказчика.
- Секреты в текстах: токены, ключи, пароли, случайно попавшие в документы — на стыке с практиками из материала про утечки через корпоративные чат-боты.
Как работает Presidio
Базовый открытый инструмент — Presidio от Microsoft, распространяется под лицензией MIT. Архитектура проста и расширяема: конвейер распознавания (NER-модель для именованных сущностей + регулярные выражения + словари + контрольные суммы для проверяемых идентификаторов) находит сущности в тексте; конвейер анонимизации применяет политики — замену плейсхолдером, хэширование, псевдонимизацию с обратимым соответствием. Из коробки Presidio лучше всего распознаёт международные форматы; для русских идентификаторов мы пишем собственные распознаватели — ИНН и СНИЛС проверяются контрольными суммами, организации и ФИО — NER-моделями и словарями заказчика. Всё это работает в контуре заказчика, без передачи данных наружу.
Маскирование и псевдонимизация: что выбрать
Два режима решают разные задачи. Необратимое маскирование (сущность заменяется типизированным плейсхолдером навсегда) применяется там, где восстановление не нужно: аналитика, логи, обучающие корпуса. Псевдонимизация (каждой сущности присваивается стабильный псевдоним, соответствие хранится отдельно под защитой) нужна, когда ответ модели должен вернуться человеку с его настоящими данными: «договор №X клиента Y» — модель работает с псевдонимами, финальный текст восстанавливает конвейер. Псевдонимы стабильны в рамках документа или процесса — модель видит согласованные ссылки, а не случайный шум, и качество ответов не проседает.
Как применяем: контур в конвейере
- Инвентаризация потоков. Какие поля и типы сущностей проходят в модели, где хранятся, кому видны; перечень согласовывается с безопасности и юристами.
- Настройка распознавателей. Presidio + кастомные распознаватели под русские идентификаторы и отраслевые термины; тестовый набор с разметкой.
- Политики замены. Режимы (маскирование/псевдонимизация) по типам сущностей; хранилище соответствий — отдельно, с доступом по роли.
- Встраивание в конвейер. Маскирование до вызова модели, восстановление после; контроль качества обоих направлений на тестовом наборе.
- Мониторинг качества. Доля распознанных сущностей и ложных срабатываний меряется регулярно; контур подключается к LLMOps-мониторингу.
- Регламент и обучение. Кто и как меняет списки сущностей; что делать при инциденте; как контур проходит внутренний аудит.
Текстовая схема: входящий текст → распознавание сущностей (NER + regex + словари + контрольные суммы) → политика замены (маскирование/псевдонимизация) → LLM (облачный API или локальная модель) → восстановление псевдонимов → ответ потребителю.
| Формат | Цена | Срок |
|---|---|---|
| Аудит потоков данных и перечень сущностей | от 90 000 ₽ | 1–2 недели |
| Пилот: Presidio + русские распознаватели + конвейер | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: политики, мониторинг качества | от 690 000 ₽ | 4–6 недель |
| Расширенный контур: псевдонимизация, аудит, интеграции | 0,9–1,2 млн ₽ | 6–8 недель |
Границы: что маскирование не защищает
Честность важнее маркетинга: маскирование распознанных сущностей — не синоним полной анонимизации. Квази-идентификаторы (редкие комбинации оставшихся признаков — должность + город + диагноз) иногда позволяют косвенно определить человека; уникальные события («авария на станции N в понедельник») деанонимизируют контекст. Поэтому зрелые контуры дополняются оценкой рисков ре-идентификации и, где требуется формальная гарантия, методами из материала про дифференциальную приватность или переходом на синтетические данные. Юридическую рамку обработки — независимо от маскирования — задаёт материал про персональные данные для обучения ИИ.
Маскирование и облачные API
Типовой вопрос: «можно ли с маскированием использовать облачные GigaChat/YandexGPT API?» Маскирование существенно снижает риски: в провайдер уходят данные без очевидных персональных сущностей. Но решение зависит от вашей внутренней политики и категории данных: для специальных категорий и государственных контуров наш ответ обычно — локальный инференс (vLLM или TensorRT-LLM в собственном контуре), где маскирование работает как второй рубеж. Для операционных сценариев с обычными категориями маскирование + облачный API по договору обработки — рабочая и экономичная схема; выбор фиксируется в модели угроз документа проекта.
Тонкости, которые всплывают в проектах
Первая — ложные срабатывания разрушительны для доверия: если система замаскирует половину имён товаров или терминов, пользователи отключат контур; точность настройки на ваших данных — половина проекта. Вторая — сохранение полезности: замена должна быть типизированной и стабильной («[PERSON_1]»), чтобы модель не теряла смысловые связи; качество ответов после маскирования проверяется контрольным набором — методика про оценку качества LLM. Третья — жизненный цикл словарей: новые форматы документов и сущностей появляются постоянно, распознаватели обновляются регламентно. Четвёртая — ключи псевдонимизации: доступ к соответствиям — самое чувствительное место контура, оно защищается отдельно и аудируется. Пятая — границы типов: список того, что считается чувствительным, различается между заказчиками и отраслями, поэтому перечень сущностей согласуется с вашим юристом и службой безопасности до настройки, а не подбирается «по умолчанию» из общих списков.
Контроль качества распознавания
Конвейер маскирования — это тоже система с качеством, которое нужно измерять. Мы собираем тестовый набор: документы и запросы с разметкой всех чувствительных сущностей; на нём считаются полнота распознавания (какая доля сущностей поймана) и точность (какая доля найденного — действительно сущности). Полнота важнее: пропущенный паспорт в логе — инцидент; лишнее замаскированное слово — раздражение. Пороги задаются под категорию данных: для специальных категорий — самые строгие.
Регулярный аудит — часть регламента: новые типы документов, опечатки, необычные форматы плавно снижают полноту, и без контрольных прогонов это обнаружится при разборе уже случившейся утечки. Метрики конвейера уходят в LLMOps-мониторинг рядом с метриками самого ИИ-сервиса — деградация маскирования видна на том же дашборде, что и деградация ответов.
Как стартуем
- Пришлите примеры документов/запросов и перечень чувствительных полей — за 1–2 недели соберём карту потоков и перечень сущностей.
- Пилот: Presidio с русскими распознавателями, конвейер «маскирование → модель → восстановление», метрики распознавания на тестовом наборе — от 480 000 ₽ за 4–6 недель.
- Промышленный контур и регламенты — по результатам пилота.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.