Что такое дифференциальная приватность
Дифференциальная приватность — не инструмент, а свойство алгоритма: гарантия того, что его результат практически не изменится, если из данных убрать любую одну запись (одного конкретного человека). Если гарантия выполнена, из результата нельзя уверенно вытащить информацию ни об одном отдельном участнике — можно говорить только о статистических закономерностях совокупности. Математический фундамент подхода разработан в группе Синтии Дворк и коллег в 2000-х годах; количественно гарантия выражается параметром ε («эпсилон») — бюджетом приватности: чем меньше ε, тем сильнее гарантия и тем больше шума вносит алгоритм.
Отличие от привычной анонимизации принципиально. Классическая анонимизация удаляет очевидные идентификаторы и «надеется», что комбинация оставшихся полей не позволит узнать человека; исследования регулярно показывали обратное — редкие комбинации признаков деанонимизируют людей в якобы обезличенных выборках. Дифференциальная приватность даёт формальную, доказуемую границу: сколько информации об отдельной записи в принципе может утечь — не больше ε. Это ответ на вопрос регуляторов и аудиторов «почему вы считаете, что данные защищены».
Где применяется
- Обучение моделей на персональных данных: скоринг, антифрод, медицинские и HR-модели с гарантией, что модель не «запомнит» конкретного клиента или пациента.
- Публикация статистики: отчёты и дашборды по чувствительным массивам с зашумлёнными агрегатами — тренды видны, отдельные записи — нет.
- Телеметрия и продукт-аналитика: сбор метрик использования с гарантией неотслеживаемости отдельных пользователей.
- Генерация синтетических данных: датагенераторы с DP-гарантией — связь с материалом про синтетические данные.
- Федеративное обучение: шум DP поверх обновлений моделей — защита от реконструкции данных из градиентов, см. материал про федеративное обучение.
DP-SGD: обучение с гарантией
Обычное обучение (стохастический градиентный спуск) запоминает данные: редкие записи буквально впечатываются в веса — исследования демонстрировали извлечение обучающих примеров из языковых моделей. DP-SGD (методика, предложенная Google Research в 2016 году) меняет два шага: каждый градиент «обрезается» до фиксированной нормы (ограничивает вклад одной записи) и к сумме добавляется калиброванный шум. В результате влияние любого одного примера на итоговые веса ограничено и замаскировано — с формальным подсчётом итогового ε. Готовая реализация для PyTorch — открытая библиотека Opacus под Apache 2.0: обёртка над оптимизатором, подключается к существующему коду обучения без его переписывания.
Как применяем: этапы
- Аудит данных и цели. Какие записи чувствительны, какая задача решается, готова ли она к «зашумлению» — не всякая метрика переживёт DP без потерь.
- Выбор ε и протокола. Фиксируем целевой бюджет приватности и схему учёта (сколько релизов модели/отчётов на каком ε). Бюджет не бесконечен: каждая публикация его тратит.
- Модификация обучения. Подключение Opacus (или эквивалента), настройка клиппирования и шума, обучение базовой и DP-модели параллельно.
- Замер полезности. Качество DP-модели против базовой на отложенной выборке — честная таблица «что мы теряем за гарантию».
- Аудит утечек. Атаки членства (проверка, «знает» ли модель конкретные записи) на DP-модели — эмпирическая проверка гарантии.
- Документация. ε, схема расходования бюджета, метрики полезности, результаты аудита — пакет для внутреннего аудита и регулятора.
Текстовая схема: чувствительные данные → DP-SGD (клиппирование градиентов + шум) → модель с гарантией ε → атаки членства (проверка) → публикация с учётом бюджета ε.
| Формат | Цена | Срок |
|---|---|---|
| Аудит данных и оценка применимости DP | от 90 000 ₽ | 1–2 недели |
| Пилот: DP-обучение + метрики полезности + аудит утечек | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: бюджет ε, регламенты, документация | от 690 000 ₽ | 4–6 недель |
| Расширенный контур: DP + федерация + синтетические данные | 0,9–1,2 млн ₽ | 8–10 недель |
Компромисс точности и приватности
Главный инженерный факт о DP: бесплатно не бывает. Малый ε — сильная гарантия, но больше шума и ниже качество; большой ε — качество почти без потерь, но гарантия слабее. Универсального «правильного» ε не существует — выбор зависит от чувствительности данных и требований организации; в практике встречаются значения от долей единицы до нескольких единиц на релиз. Наш подход: зафиксировать минимально приемлемое качество модели на бизнес-метриках, затем взять наименьший ε, при котором это качество удерживается, и показать заказчику обе таблицы — полезность и гарантию. Важно и композиция бюджета: два отчёта по ε каждый — это суммарно больше, чем ε; все публикации учитываются в едином реестре бюджета.
Это анонимизация или нет
Юридически и технически — разные вещи. Анонимизация (обезличивание входных данных) работает с самими записями до обработки; дифференциальная приватность — гарантия на выходе алгоритма (модели, отчёта). Они прекрасно сочетаются: входы очищаются от очевидных идентификаторов методами из материала про анонимизацию данных для LLM, а обучение или агрегация получают DP-гарантию. Правовое оформление обработки персональных данных при этом не отменяется — основания и цели обработки разбираются в материале про персональные данные для обучения ИИ.
Тонкости, которые всплывают в проектах
Первая — чувствительность к гиперпараметрам: норма клиппирования и сила шума сильно влияют на сходимость; настройки подбираются, а не копируются из туториала. Вторая — качество на редких классах страдает первыми: DP сильнее «размывает» сигналы от небольших групп — для антифрода или редких диагнозов это ключевой риск, его видно только на честной валидации. Третья — цена шума зависит от объёма данных: на больших выборках DP почти бесплатен, на маленьких — губителен; иногда честнее собрать больше данных или перейти на синтетические данные. Четвёртая — коммуникация: заказчику нужен понятный ответ «что именно гарантировано», без математики; мы готовим такую страницу в документации проекта. И пятая — фикса́ция: значение ε, параметры шума и версии библиотек записываются в документацию так же строго, как версии зависимостей, иначе гарантия не воспроизводится при следующем обучении.
Коммуникация с аудиторами и регулятором
Дифференциальную приватность сложно «продать» внутри организации, если она остаётся математикой. Поэтому пакет документации мы готовим двуслойным. Технический слой: значение ε и его обоснование, схема расходования бюджета, параметры DP-SGD, результаты атак членства как эмпирического подтверждения гарантии. Смысловой слой: человеческое объяснение «что это значит» — например, «по поведению модели нельзя уверенно установить, участвовал ли конкретный человек в обучении, и это подтверждено и математически, и атаками».
Такой пакет встраивается в внутренний аудит, и отвечать на вопросы регулятора становится проще: вместо «мы обезличили данные» — измеримая гарантия с границами. Опыт показывает, что второй слой важнее первого: именно он превращает технологию из исследовательской экзотики в понятную меру защиты, за которую готова отвечать служба безопасности.
Как стартуем
- Пришлите описание задачи и природы данных — за 1–2 недели оценим применимость DP и целевой диапазон ε.
- Пилот: DP-обучение с Opacus, таблица «полезность/гарантия», проверка атаками членства — от 480 000 ₽ за 4–6 недель.
- Решение о промышленном контуре — по цифрам пилота и требованиям вашего комплаенса.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.