Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Технология · защита данных в ИИ-контурах

Анонимизация данных для LLM: как используем в проектах

Пропускаем данные через контур маскирования до того, как они попадут в модель: имена, телефоны, реквизиты и другие чувствительные элементы заменяются плейсхолдерами, ответы моделей при необходимости восстанавливаются обратно. Открытый стек, контур заказчика.

Краткий ответ · сентябрь 2026

Краткий ответ: Анонимизация данных для LLM — это маскирование чувствительных элементов (ФИО, телефоны, реквизиты, адреса) до передачи в модель и восстановление при необходимости в ответе. Базовый открытый инструмент — Presidio от Microsoft (лицензия MIT), расширяемый распознавателями под русские идентификаторы. Пилот конвейера маскирования — от 480 000 ₽ за 4–6 недель.

от 480 000 ₽ — пилот конвейера маскирования за 4–6 недель НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Задача: данные в модель — без персональных

Практически каждый корпоративный LLM-сценарий встречает одно и то же препятствие: в запросах и документах, которые нужно обработать моделью, живут персональные данные и коммерческие чувствительные сведения — ФИО клиентов, телефоны, реквизиты, номера договоров, диагнозы, суммы. Отдавать их во внешний API нельзя по 152-ФЗ и внутренним политикам; отказываться от сценария — значит отказаться от автоматизации. Конвейер маскирования решает дилемму: чувствительные элементы распознаются и заменяются типизированными плейсхолдерами до модели, а в ответе модели при необходимости восстанавливаются.

Отдельный класс задачи — «отдать на обработку вообще нельзя»: например, журналы и трейсы, которые собирает LLMOps-мониторинг, или обучающие выборки. Там маскирование применяется в одну сторону, без восстановления. Обе постановки закрываются одним технологическим контуром с разной конфигурацией.

Что распознаём и маскируем

  • Персональные данные: ФИО, даты рождения, адреса, телефоны, адреса почты, паспортные данные, СНИЛС, ИНН.
  • Платёжные и финансовые: номера карт и счетов, суммы по конкретным клиентам.
  • Специальные категории: медицинские сведения, биометрия в текстовом виде — самый строгий режим обработки.
  • Коммерчески чувствительные: номера договоров, ценовые условия, внутренние коды — по перечню заказчика.
  • Секреты в текстах: токены, ключи, пароли, случайно попавшие в документы — на стыке с практиками из материала про утечки через корпоративные чат-боты.

Как работает Presidio

Базовый открытый инструмент — Presidio от Microsoft, распространяется под лицензией MIT. Архитектура проста и расширяема: конвейер распознавания (NER-модель для именованных сущностей + регулярные выражения + словари + контрольные суммы для проверяемых идентификаторов) находит сущности в тексте; конвейер анонимизации применяет политики — замену плейсхолдером, хэширование, псевдонимизацию с обратимым соответствием. Из коробки Presidio лучше всего распознаёт международные форматы; для русских идентификаторов мы пишем собственные распознаватели — ИНН и СНИЛС проверяются контрольными суммами, организации и ФИО — NER-моделями и словарями заказчика. Всё это работает в контуре заказчика, без передачи данных наружу.

Маскирование и псевдонимизация: что выбрать

Два режима решают разные задачи. Необратимое маскирование (сущность заменяется типизированным плейсхолдером навсегда) применяется там, где восстановление не нужно: аналитика, логи, обучающие корпуса. Псевдонимизация (каждой сущности присваивается стабильный псевдоним, соответствие хранится отдельно под защитой) нужна, когда ответ модели должен вернуться человеку с его настоящими данными: «договор №X клиента Y» — модель работает с псевдонимами, финальный текст восстанавливает конвейер. Псевдонимы стабильны в рамках документа или процесса — модель видит согласованные ссылки, а не случайный шум, и качество ответов не проседает.

Как применяем: контур в конвейере

  1. Инвентаризация потоков. Какие поля и типы сущностей проходят в модели, где хранятся, кому видны; перечень согласовывается с безопасности и юристами.
  2. Настройка распознавателей. Presidio + кастомные распознаватели под русские идентификаторы и отраслевые термины; тестовый набор с разметкой.
  3. Политики замены. Режимы (маскирование/псевдонимизация) по типам сущностей; хранилище соответствий — отдельно, с доступом по роли.
  4. Встраивание в конвейер. Маскирование до вызова модели, восстановление после; контроль качества обоих направлений на тестовом наборе.
  5. Мониторинг качества. Доля распознанных сущностей и ложных срабатываний меряется регулярно; контур подключается к LLMOps-мониторингу.
  6. Регламент и обучение. Кто и как меняет списки сущностей; что делать при инциденте; как контур проходит внутренний аудит.

Текстовая схема: входящий текст → распознавание сущностей (NER + regex + словари + контрольные суммы) → политика замены (маскирование/псевдонимизация) → LLM (облачный API или локальная модель) → восстановление псевдонимов → ответ потребителю.

ФорматЦенаСрок
Аудит потоков данных и перечень сущностейот 90 000 ₽1–2 недели
Пилот: Presidio + русские распознаватели + конвейерот 480 000 ₽4–6 недель
Промышленный контур: политики, мониторинг качестваот 690 000 ₽4–6 недель
Расширенный контур: псевдонимизация, аудит, интеграции0,9–1,2 млн ₽6–8 недель

Границы: что маскирование не защищает

Честность важнее маркетинга: маскирование распознанных сущностей — не синоним полной анонимизации. Квази-идентификаторы (редкие комбинации оставшихся признаков — должность + город + диагноз) иногда позволяют косвенно определить человека; уникальные события («авария на станции N в понедельник») деанонимизируют контекст. Поэтому зрелые контуры дополняются оценкой рисков ре-идентификации и, где требуется формальная гарантия, методами из материала про дифференциальную приватность или переходом на синтетические данные. Юридическую рамку обработки — независимо от маскирования — задаёт материал про персональные данные для обучения ИИ.

Маскирование и облачные API

Типовой вопрос: «можно ли с маскированием использовать облачные GigaChat/YandexGPT API?» Маскирование существенно снижает риски: в провайдер уходят данные без очевидных персональных сущностей. Но решение зависит от вашей внутренней политики и категории данных: для специальных категорий и государственных контуров наш ответ обычно — локальный инференс (vLLM или TensorRT-LLM в собственном контуре), где маскирование работает как второй рубеж. Для операционных сценариев с обычными категориями маскирование + облачный API по договору обработки — рабочая и экономичная схема; выбор фиксируется в модели угроз документа проекта.

Тонкости, которые всплывают в проектах

Первая — ложные срабатывания разрушительны для доверия: если система замаскирует половину имён товаров или терминов, пользователи отключат контур; точность настройки на ваших данных — половина проекта. Вторая — сохранение полезности: замена должна быть типизированной и стабильной («[PERSON_1]»), чтобы модель не теряла смысловые связи; качество ответов после маскирования проверяется контрольным набором — методика про оценку качества LLM. Третья — жизненный цикл словарей: новые форматы документов и сущностей появляются постоянно, распознаватели обновляются регламентно. Четвёртая — ключи псевдонимизации: доступ к соответствиям — самое чувствительное место контура, оно защищается отдельно и аудируется. Пятая — границы типов: список того, что считается чувствительным, различается между заказчиками и отраслями, поэтому перечень сущностей согласуется с вашим юристом и службой безопасности до настройки, а не подбирается «по умолчанию» из общих списков.

Контроль качества распознавания

Конвейер маскирования — это тоже система с качеством, которое нужно измерять. Мы собираем тестовый набор: документы и запросы с разметкой всех чувствительных сущностей; на нём считаются полнота распознавания (какая доля сущностей поймана) и точность (какая доля найденного — действительно сущности). Полнота важнее: пропущенный паспорт в логе — инцидент; лишнее замаскированное слово — раздражение. Пороги задаются под категорию данных: для специальных категорий — самые строгие.

Регулярный аудит — часть регламента: новые типы документов, опечатки, необычные форматы плавно снижают полноту, и без контрольных прогонов это обнаружится при разборе уже случившейся утечки. Метрики конвейера уходят в LLMOps-мониторинг рядом с метриками самого ИИ-сервиса — деградация маскирования видна на том же дашборде, что и деградация ответов.

Как стартуем

  1. Пришлите примеры документов/запросов и перечень чувствительных полей — за 1–2 недели соберём карту потоков и перечень сущностей.
  2. Пилот: Presidio с русскими распознавателями, конвейер «маскирование → модель → восстановление», метрики распознавания на тестовом наборе — от 480 000 ₽ за 4–6 недель.
  3. Промышленный контур и регламенты — по результатам пилота.

Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.

Смотрите также

Частые вопросы: Анонимизация данных для LLM на практике

Анонимизация данных для LLM — это маскирование чувствительных элементов (ФИО, телефоны, реквизиты, адреса) до передачи в модель и восстановление при необходимости в ответе. Базовый открытый инструмент — Presidio от Microsoft (лицензия MIT), расширяемый распознавателями под русские идентификаторы. Пилот конвейера маскирования — от 480 000 ₽ за 4–6 недель.

Базовая конфигурация ориентирована на международные форматы, поэтому для российских идентификаторов мы пишем кастомные распознаватели: ИНН и СНИЛС проверяются контрольными суммами, организации и ФИО — NER-моделями и словарями заказчика. Точность распознавания меряется на вашем тестовом наборе и фиксируется в приёмке.

При типизированных стабильных плейсхолдерах модель сохраняет смысловые связи («клиент [PERSON_1] заключил договор [CONTRACT_2]»). Контроль качества до/после маскирования входит в пилот: сравнение ответов на контрольном наборе показывает реальное влияние, и порог приемлемости задаёте вы.

Маскирование распознанных сущностей снижает риски, но не даёт автоматически юридической «анонимизации»: комбинации оставшихся признаков могут косвенно идентифицировать человека. Поэтому контур дополняется оценкой рисков ре-идентификации, а где нужна формальная гарантия — дифференциальной приватностью или синтетическими данными. Правовой вывод всегда фиксируется юристом под ваш случай.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты — по состоянию на сентябрь 2026 (19.09.2026), из канона ответов для ИИ new-sst.ru. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).