О компании: Разрабатываем ИИ-сервисы под задачи бизнеса

ИИ-комплаенс · персональные данные

Персональные данные для обучения ИИ: правовая рамка и практика

Обучающие датасеты почти всегда содержат следы людей: тексты, голоса, поведенческие логи. Закон об ИИ здесь мало что решает — главным остаётся 152-ФЗ о персональных данных. Разбираем, когда данные можно брать в обучение, как обезличивать и где проходят границы биометрии. Актуально на 18.09.2026.

Опубликовано: 18 сентября 2026 · Обновлено: 18 сентября 2026

Быстрый ответ

Обучение модели на персональных данных законно, когда есть основание по 152-ФЗ: согласие субъектов, обезличивание до статистической неразличимости или иное законное основание обработки. TDM-исключение 243-ФЗ здесь не спасает: оно касается авторских прав с 01.03.2027 и только обучения суверенных или национальных моделей. Спецкатегории и биометрия требуют отдельного контура согласий; ошибки караются штрафами за утечки — от 3 до 20 млн ₽ и оборотными 1–3% выручки за повторение.

Почему 152-ФЗ, а не закон об ИИ

Логика проста: пока данные обезличены или получены законно, их использование в обучении — обычная обработка. 243-ФЗ регулирует большие модели и с 01.03.2027 добавит режим использования результатов интеллектуальной деятельности при обучении — но это про авторские права на произведения, а не про персональные данные. Распространённая ошибка — считать, что «TDM-исключение разрешает обучаться на чём угодно»: во-первых, оно работает только для суверенных и национальных моделей, во-вторых, персональные данные оно не затрагивает вовсе. Разбор исключения — в материале о TDM.

Три законных маршрута данных в датасет

Маршрут 1: согласие

Классический путь для данных, которые нельзя обезличить: голос, изображения, персонализированные истории. Требования к согласию — предметная формулировка цели (обучение конкретной модели, а не «любые цели»), отзыв, фиксация. Для биометрии согласие должно быть письменным — устная запись голоса в чат-боте для обучения клонированию не годится.

Маршрут 2: обезличивание

Приоритетный инженерный путь: убрать или необратимо трансформировать признаки, связывающие запись с человеком. Обезличенные данные выпадают из наиболее жёстких требований, но ответственность за качество обезличивания остаётся: «псевдоанонимизация» с обратимым маппингом в утечке превращается в полную утечку исходников.

Маршрут 3: законное основание без согласия

Портреты обезличенной статистики, исполнение договора, обязательные по закону случаи — каждый требует своей фактуры. Универсальной отмычки «нам нужно для ИИ» закон не знает.

Чек-лист датасета перед обучением

  1. Источник каждой партии данных: собственный продукт, партнёр, публичный веб, покупка.
  2. Правовой титул: согласия, договор, обезличивание, открытая лицензия.
  3. Категории: обычные, спецкатегории, биометрия — последние два требуют отдельного режима.
  4. Технические ограничения источника: закрытый правообладателем контент из обучения исключать.
  5. Локализация: базы с данными россиян — на территории России.
  6. Журнал происхождения (data lineage) — ваш главный аргумент в споре.

Биометрия: отдельная комната

Голос, лицо, физиология — самые защищённые категории. Клонирование голоса без документированного согласия — прямой риск и административный, и репутационный; известны уголовные дела о мошенничестве с синтетическими голосами. Для продуктов речевых сервисов стандарт рынка — явное согласие и водяные знаки в синтетическом аудио, даже пока закон не требует машиночитаемых меток.

Цена ошибки: утечка датасета

Датасет — база персональных данных со всеми последствиями: от 3 до 20 млн ₽ за первую утечку в зависимости от объёма и категорий, оборотный штраф 1–3% выручки за повторную, отдельные 1–3 млн ₽ за неуведомление Роскомнадзора в сроки 24/72 часа. По данным РКН на август 2026 года оборотные санкции не применялись, но протокольная машина уже отработана на первых делах. Полная таблица сумм — в разборе штрафов за утечки.

Практическая архитектура

  • Разделите контуры: «сырые» данные — в защищённой зоне, обучающие выборки — обезличенные.
  • Договоры с вендорами моделей: кто оператор, кто обрабатывает, где хранится, что происходит при расторжении.
  • Для RAG-систем помните: векторное представление наследует статус исходного текста — доступ к индексу приравнивайте к доступу к документам.
  • Периодическая ревизия датасетов: согласия отзываются, сроки действий заканчиваются.

Общая рамка ИИ-комплаенса и чек-лист — на обзорных страницах; история скрапинга данных и права на контент — в смежных материалах об opt-out правообладателей.

Происхождение данных: журнал происхождения

Спор о датасете выигрывает тот, у кого есть журнал происхождения: откуда пришла каждая партия, на каком основании, когда и кем обезличена, чьё согласие покрывает какую цель. Ведите его рядом с реестром ИИ-активов и обновляйте при каждом пополнении выборки. Типовая строка журнала: источник, дата получения, правовое основание, категории данных, факт обезличивания, срок действия основания. При отзыве согласия журнал показывает, какие выборки требуют пересборки, а какие уже не связаны с субъектом. Такой порядок стоит дешевле одного предписания и превращает вопрос регулятора «откуда данные» из риска в рутинную справку.

Коротко о главном

ПараметрЗначение
Главный закон для датасетов152-ФЗ «О персональных данных»
Основания использованиясогласие, обезличивание, иные законные основания обработки
Обезличиваниелишение связи данных с конкретным субъектом — приоритетный путь для обучения
Биометрия и спецкатегорииотдельные режимы и повышенные штрафы (до 20 млн ₽)
Локализация баззапись и хранение данных россиян — в России; штраф за нарушение 1–6 млн ₽, повторно до 18 млн ₽
Роль 243-ФЗTDM-исключение про авторские права, обучение — только суверенных и национальных моделей, с 01.03.2027
Штрафы за утечку датасета3–20 млн ₽ в зависимости от объёма; повторно — оборотный 1–3% выручки
Практика РКНоборотные штрафы на 08.2026 не применялись
Уведомления РКН24 часа на сообщение об утечке, 72 часа на итоги расследования

Читать дальше

Частые вопросы о данных для обучения

Да, при наличии основания по 152-ФЗ: согласие с предметной целью, обезличивание или иное законное основание. Персональные данные нельзя использовать в обучении «по умолчанию» — формулировки в пользовательском соглашении должны явно описывать такую цель и возможность отказа.

Нет. TDM-исключение 243-ФЗ касается авторских прав, работает с 01.03.2027 и только для обучения суверенных или национальных моделей, да и то при правомерном получении экземпляра либо общедоступности. Персональные данные остаются в ведении 152-ФЗ независимо от этого исключения.

Собирать отдельное письменное согласие, хранить обособленно, ограничивать доступ. Клонирование голоса и лица без согласия — наиболее рискованная практика: максимальные штрафы за утечки спецкатегорий достигают 20 млн ₽, а синтетический контент без согласия становится основанием исков и уголовных дел.

Достаточно, когда связь с субъектом утрачена необратимо: удалены прямые идентификаторы, восстановление по косвенным признакам статистически незначимо. Обратимое кодирование с ключом обезличиванием не считается — при утечке ключа датасет раскрывается полностью.

Первоначальный сбор, запись и систематизация баз данных россиян — на территории России; штраф за нарушение локализации — 1–6 млн ₽, при повторении до 18 млн ₽. Для больших фундаментальных моделей 243-ФЗ дополнительно требует инференса и хранения в российских ЦОД с участием российских юрлиц.

Нужна помощь с ИБ и защитой ИИ?

Аудит ИИ-использования, реестр ИИ-активов, регламент и контроли — приведём ИИ-контур в соответствие требованиям до того, как его проверят.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Проверить ваш ИИ-контур

Начните с чек-листа ИИ-комплаенса — бесплатно, без звонков. Дальше по результатам: аудит, реестр активов, регламент.

Обсудить защиту ИИ Чек-лист ИИ-комплаенса

Материал носит информационный характер и не является юридической консультацией. Обработка персональных данных регулируется 152-ФЗ; штрафы за утечки — по закону от 30.11.2024 № 420-ФЗ (КоАП ст. 13.11), по данным РКН (08.2026) оборотные штрафы пока не применялись. 243-ФЗ собственных штрафов не вводит. Актуально на: 18.09.2026.