Почему 152-ФЗ, а не закон об ИИ
Логика проста: пока данные обезличены или получены законно, их использование в обучении — обычная обработка. 243-ФЗ регулирует большие модели и с 01.03.2027 добавит режим использования результатов интеллектуальной деятельности при обучении — но это про авторские права на произведения, а не про персональные данные. Распространённая ошибка — считать, что «TDM-исключение разрешает обучаться на чём угодно»: во-первых, оно работает только для суверенных и национальных моделей, во-вторых, персональные данные оно не затрагивает вовсе. Разбор исключения — в материале о TDM.
Три законных маршрута данных в датасет
Маршрут 1: согласие
Классический путь для данных, которые нельзя обезличить: голос, изображения, персонализированные истории. Требования к согласию — предметная формулировка цели (обучение конкретной модели, а не «любые цели»), отзыв, фиксация. Для биометрии согласие должно быть письменным — устная запись голоса в чат-боте для обучения клонированию не годится.
Маршрут 2: обезличивание
Приоритетный инженерный путь: убрать или необратимо трансформировать признаки, связывающие запись с человеком. Обезличенные данные выпадают из наиболее жёстких требований, но ответственность за качество обезличивания остаётся: «псевдоанонимизация» с обратимым маппингом в утечке превращается в полную утечку исходников.
Маршрут 3: законное основание без согласия
Портреты обезличенной статистики, исполнение договора, обязательные по закону случаи — каждый требует своей фактуры. Универсальной отмычки «нам нужно для ИИ» закон не знает.
Чек-лист датасета перед обучением
- Источник каждой партии данных: собственный продукт, партнёр, публичный веб, покупка.
- Правовой титул: согласия, договор, обезличивание, открытая лицензия.
- Категории: обычные, спецкатегории, биометрия — последние два требуют отдельного режима.
- Технические ограничения источника: закрытый правообладателем контент из обучения исключать.
- Локализация: базы с данными россиян — на территории России.
- Журнал происхождения (data lineage) — ваш главный аргумент в споре.
Биометрия: отдельная комната
Голос, лицо, физиология — самые защищённые категории. Клонирование голоса без документированного согласия — прямой риск и административный, и репутационный; известны уголовные дела о мошенничестве с синтетическими голосами. Для продуктов речевых сервисов стандарт рынка — явное согласие и водяные знаки в синтетическом аудио, даже пока закон не требует машиночитаемых меток.
Цена ошибки: утечка датасета
Датасет — база персональных данных со всеми последствиями: от 3 до 20 млн ₽ за первую утечку в зависимости от объёма и категорий, оборотный штраф 1–3% выручки за повторную, отдельные 1–3 млн ₽ за неуведомление Роскомнадзора в сроки 24/72 часа. По данным РКН на август 2026 года оборотные санкции не применялись, но протокольная машина уже отработана на первых делах. Полная таблица сумм — в разборе штрафов за утечки.
Практическая архитектура
- Разделите контуры: «сырые» данные — в защищённой зоне, обучающие выборки — обезличенные.
- Договоры с вендорами моделей: кто оператор, кто обрабатывает, где хранится, что происходит при расторжении.
- Для RAG-систем помните: векторное представление наследует статус исходного текста — доступ к индексу приравнивайте к доступу к документам.
- Периодическая ревизия датасетов: согласия отзываются, сроки действий заканчиваются.
Общая рамка ИИ-комплаенса и чек-лист — на обзорных страницах; история скрапинга данных и права на контент — в смежных материалах об opt-out правообладателей.
Происхождение данных: журнал происхождения
Спор о датасете выигрывает тот, у кого есть журнал происхождения: откуда пришла каждая партия, на каком основании, когда и кем обезличена, чьё согласие покрывает какую цель. Ведите его рядом с реестром ИИ-активов и обновляйте при каждом пополнении выборки. Типовая строка журнала: источник, дата получения, правовое основание, категории данных, факт обезличивания, срок действия основания. При отзыве согласия журнал показывает, какие выборки требуют пересборки, а какие уже не связаны с субъектом. Такой порядок стоит дешевле одного предписания и превращает вопрос регулятора «откуда данные» из риска в рутинную справку.