Юридическая судьба ИИ-проекта решается там, где его реже всего ждут, — в папке с датасетами. С марта 2027-го обучение на общедоступных произведениях живёт в режиме TDM: правомерно, пока правообладатель технически не закрыл доступ. Но режим предполагает доказуемость: откуда данные, на каком основании, когда получены. Этот разбор — о практической дисциплине происхождения обучающих данных: что фиксировать, как проводить аудит и какие ошибки дорого обходятся.
Юридическая механика TDM-исключения — в разборе TDM-режима и страницы о коллизии с ГК РФ; позиция правообладателей — в материале об opt-out. Здесь — взгляд ML-команды.
Почему происхождение стало критичным
До 2026 года вопрос «откуда датасет» в большинстве команд решался неформально: скачали, почистили, обучили. Два изменения сделали это роскошью. Первое — TDM-режим 243-ФЗ: он защищает обучение, но опирается на правомерность получения и учёт технических запретов правообладателей. Второе — рыночное: заказчики и аудиторы спрашивают про данные в due diligence, а статусы моделей требуют воспроизводимости.
Недоказуемое происхождение — это не абстрактный риск. Опубликованная модель, обученная на данных без истории, уязвима для претензий и не проходит аудит соответствия. Восстанавливать происхождение постфактум — на порядок дороже, чем фиксировать в момент сбора.
Карточка датасета: что фиксировать
Минимальная рабочая единица документирования — карточка датасета. Международная практика (data cards, datasheets) давно стандартизировала поля; для российского контекста с 243-ФЗ набор такой:
| Поле | Что записывать | Зачем |
|---|---|---|
| Источник | URL, поставщик, репозиторий, договор | Доказательство правомерного получения |
| Правовое основание | Лицензия, договор, публичная доступность | Связь с TDM-режимом и ГК РФ |
| Дата и способ получения | Когда и как выгружен, версия | Соответствие лицензии на момент сбора |
| Состав и объём | Типы данных, количество записей, языки | Воспроизводимость и оценка рисков |
| Ограничения | Opt-out правообладателя, запреты лицензии | Учёт технических мер правообладателя |
| Персональные данные | Наличие, основание обработки, обезличивание | 152-ФЗ при обучении и инференсе |
Карточка живёт рядом с данными — в реестре ИИ-активов. Как вести сам учёт — описано в гайде по реестру активов.
Четыре категории данных — четыре основания
Дисциплина проще, когда категории разведены по правовым режимам:
- Собственные данные — сгенерированы компанией или получены от пользователей с согласием. Основание: пользовательские соглашения и согласия на обработку. Зона 152-ФЗ, если данные персональные.
- Лицензионные данные — куплены или получены по лицензии. Основание: договор. Фиксируйте срок, объём и право на обучение — не всякая лицензия его покрывает.
- Публично доступные произведения — собраны из открытых источников. Основание: TDM-режим с марта 2027 года — при правомерном сборе и с учётом технических запретов владельцев прав.
- Персональные данные — особый режим 152-ФЗ независимо от источника: оценка вреда, основания, при обучении — внимание к цели и объёму. Практика — в материале о ПДн при разработке ПО.
Смешение категорий — источник большинства нарушений: «публичный» датасет с вшитыми персональными данными, лицензия без права на обучение, «временно взятые» данные подрядчика.
Категории на примерах
Покажем, как категории работают на типовых наборах. Датасет отзывов из вашего приложения — собственные данные: основание в пользовательском соглашении, персональные данные — обезличить до обучающей выборки. Корпус новостей, выгруженный из открытых источников по API, — публично доступные произведения: работает TDM-режим, но проверьте технические запреты источника и условия API на момент выгрузки. Купленная база судебных решений — лицензионные данные: в договоре должно прямо разрешаться машинное обучение. Дамп из мессенджера, переданный «по дружбе» коллегой, — не категория, а инцидент: оснований нет, персональные данные есть; такой набор выводится из обучения и возвращается отправителю с разъяснением, а сам случай фиксируется как урок для процесса сбора.
Ключ к категориям — простой вопрос «на каком основании данные у нас?» вместо «где мы их взяли?». Первый вопрос даёт правовой ответ, второй — только историю поиска.
Аудит происхождения: пять шагов
Если история данных не велась, аудит восстанавливает её за две-четыре недели на типовой проект:
Шаг 1 — инвентаризация. Перечислите все датасеты в обучающих пайплайнах, включая «забытые» валидационные выборки и данные разметки.
Шаг 2 — восстановление источников. Логи выгрузок, история репозиториев, переписка с поставщиками. Что не восстанавливается — помечается риском.
Шаг 3 — проверка оснований. Для каждого источника: лицензия на момент сбора, действующий договор, наличие технических запретов.
Шаг 4 — решение по рискам. Исключить, переоформить или оставить с фиксацией остаточного риска. Обучение на спорных данных до решения — лучшее, что можно сделать для будущей претензии.
Шаг 5 — карточки и регламент. Оформите карточки по итогам и правила сбора на будущее: карточка создаётся до выгрузки, а не после.
Разметка и подготовка данных — отдельный блок работ: разметка данных для ИИ; аудит ИИ-активов — от 90 000 ₽, полный цикл работы с данными — от 480 000 ₽ (сентябрь 2026, не оферта).
Как выглядит зрелый конвейер данных
Команды, прошедшие аудит без замечаний, обычно выстраивают такой порядок: заявка на датасет заводится до выгрузки, карточка создаётся в момент получения, лицензия или источник прикладываются файлом, скрипт обезличивания прогоняется до записи данных в обучающее хранилище, а доступ к «сырым» датасетам разграничен ролями. Раз в квартал реестр сверяется с фактом: скрипт обходит обучающие пайплайны и сравнивает список использованных данных с карточками. Расхождение — инцидент с разбором причин.
Звучит бюрократично, но на практике занимает минуты: карточка — форма из шести полей, сверка — автоматический отчёт, а совещание по расхождениям — пятнадцать минут в чате без отдельных встреч, протоколов и согласований. Команды, внедрившие такой порядок на практике, отмечают полезный побочный эффект: обсуждение новых фич начинается с вопроса «на каких данных», и это дисциплинирует продуктовые решения не хуже, а иногда и лучше чисто юридических. Затраты на такой конвейер несопоставимы со стоимостью пересборки модели после исключения компрометированного датасета. Фактическая стоимость конвейера — один рабочий день на запуск и почти ноль на дальнейшую поддержку в штатном режиме.
Мини-кейс: аудит трёх датасетов
Команда маркетинговой аналитики обучает классификатор тональности на трёх датасетах: выгрузка отзывов из собственного сервиса, купленный корпус и «архив из интернета», собранный стажёром два года назад. Аудит показывает: собственные отзывы — в порядке, согласия покрывают обезличенную обработку; купленный корпус — лицензия не покрывает дообучение, нужен апгрейд договора; архив — без истории, в нём находятся персональные данные. Решения: корпус переоформляется за неделю, архив режется на две части — обезличенная остаётся с пометкой «источник неизвестен», фрагменты с персональными данными выводятся. Модель переобучается за день, досье датасетов закрывает вопрос на ближайшую проверку.
Типичные ошибки команд
Первая — «данные общие, разберёмся потом»: папка без истории превращается в нематериальный актив с неограниченной ответственностью. Вторая — чтение лицензии по заголовку: open dataset не значит «можно в коммерческое обучение». Третья — игнорирование opt-out: правообладатель, закрывший доступ технически, выводит его произведения из TDM-режима. Четвёртая — обезличивание «на глаз»: псевдонимизация без проверки обратимости не снимает режим персональных данных.
Итог
Происхождение обучающих данных — новая обязательная часть ИИ-гигиены: карточки датасетов, разведённые категории, аудит неизвестного и регламент на будущее. Это не бюрократия, а страховка: доказуемое происхождение конвертируется в защиту при претензиях, прохождение аудита и допуск к статусам. Материал описывает практику документирования и не является юридическим заключением по конкретным данным. НЬЮ-ССТ проводит аудит датасетов и строит конвейеры данных с контролем происхождения — в рамках аудита соответствия. Обсудить ваши датасеты — в форме в конце материала.