Зачем проверять датасет до обучения, а не после
Обученная модель «помнит» данные: если в датасет попали украденные персональные данные или произведения, собранные с нарушением, удалить их из модели после обучения нельзя — только переобучение с нуля. Для больших моделей это месяцы работы и прямые убытки.
Второй аргумент — маркетинговый: заказчики и инвесторы всё чаще запрашивают подтверждение чистоты данных («data provenance»). Разработчик, который может показать таблицу источников с правовым статусом каждого, выигрывает у того, кто отвечает «собрали из открытых источников».
Третий — регуляторный: с 01.03.2027 действуют нормы 243-ФЗ о результатах интеллектуальной деятельности при обучении моделей, и юридическая карта датасета станет частью доказательной базы добросовестности.
Правовая рамка: пять слоёв проверки
Слой 1. Авторские права и TDM-исключение. Ст. 10 ч. 2 243-ФЗ (с 01.03.2027): не является нарушением авторских прав обращение к информации в охраняемых объектах «в целях практического применения содержащихся в них положений» — извлечение, сравнение, классификация, анализ закономерностей, воспроизведение через краткосрочную запись в память. Условия: обучение только суверенной или национальной модели и правомерность получения экземпляра либо общедоступность без технических ограничений. Фактически это opt-out: пока правообладатель не закрыл доступ техническими средствами, обучать можно; машиночитаемый запрет «не обучать» законом не закреплён.
Важно: правообладателям договорного запрета мало — защищать контент нужно техническими средствами. И наоборот, разработчику: скольжение мимо технического барьера (обход CAPTCHA, paywall) выводит источник из TDM-защиты.
Слой 2. Спорная зона: коллизия с ГК. Ограничение исключительных прав введено не Гражданским кодексом, а специальным законом — замечание Совета при Президенте по кодификации законодательства (пересказ ppt.ru). Это юридический спор, а не settled law: возможны либо поправки в ГК, либо судебная практика. В документации датасета фиксируйте дату и источник каждого массива — это защита на случай изменения трактовок.
Слой 3. Персональные данные. Если в датасете есть персональные данные — проверяются: правовое основание обработки (согласие, договор, закон), цель (обучение должно быть покрыто основанием), локализация баз при спецкатегориях. Отдельно — биометрия (голос, лицо): сбор и использование требуют письменных согласий. Утечка обучающего набора с персональными данными — обычная утечка: штрафы по ч. 13–14 ст. 13.11 КоАП до 20 млн ₽ (нормы введены законом от 30.11.2024 № 420-ФЗ).
Слой 4. Лицензии открытых датасетов и моделей. Открытые наборы данных приходят с лицензиями (разные варианты открытых лицензий с условиями коммерческого использования и атрибуции). Для дообучения открытых моделей проверяется лицензия самой модели: право на коммерческое использование, изменения, дистрибуцию производных версий. Национальная модель по 243-ФЗ может включать сторонние компоненты по открытой лицензии — но существенные характеристики определяет российский разработчик.
Слой 5. Договорные ограничения. Источники по договорам (купленные датасеты, данные партнёров, скрапинг по API-соглашениям): проверяются цели использования в договоре — часто «аналитика» не покрывает «обучение моделей», и нужно допсоглашение.
Состав аудита: что проверяем по каждому источнику
- Происхождение: как получен массив (собственный, покупка, открытый источник, сбор роботом).
- Правовой статус: права на объекты в составе; лицензия и её условия; ограничения.
- Персональные данные: есть/нет; категория; основание обработки; локализация.
- Технические ограничения источника: был ли доступ за платформами/ограничениями (для TDM-анализа).
- Договорные условия: цели, территория, срок, право на производные продукты.
- Вывод: можно использовать / можно с условиями / нельзя; фиксируемое обоснование.
Результат — реестр источников датасета: таблица «источник → статус → условия → дата проверки → ответственный». Такой реестр — рабочий документ и для споров, и для вопросов заказчиков, и для будущих проверок по 243-ФЗ.
Календарь разработчика: что и когда делать
| Срок | Действие | Основание |
|---|---|---|
| До 31.12.2026 | Аудит прав на источники датасетов | Рекомендация дорожной карты комплаенса |
| До 31.12.2026 | Правка пользовательских соглашений (права на генерации) | ст. 10 ч. 1 243-ФЗ |
| До 28.02.2027 | Технические решения по opt-out для своих контент-активов | ст. 10 ч. 2 243-ФЗ |
| С 01.03.2027 | TDM-исключение и уведомления действуют | ст. 10 243-ФЗ |
| Постоянно | Мониторинг коллизии с ГК и подзаконных актов | юридический спор; акты не приняты |
Если вы одновременно правообладатель (свой контент-хаб, медиатека) — решите, нужен ли технический opt-out против обучения чужими моделями: договорного запрета уже недостаточно, защищать контент нужно технически.
Типовые нарушения и их цена
- Скрапинг за paywall/CAPTCHA — выпадение из TDM-защиты; претензии правообладателей.
- Голоса людей без согласий в речевом датасете — биометрия без основания: штрафы за нарушение требований к спецкатегориям, требование уничтожить данные.
- «Открытые» данные с ограниченной лицензией — нарушение условий лицензии набора (например, запрет коммерческого использования).
- Данные партнёров «на анализ» для обучения — выход за цели договора; риск расторжения и претензий.
- Отсутствие реестра источников — невозможность доказать добросовестность при споре или запросе заказчика.
Как проходит проверка у нас
- Интервью: как собирались данные, какие источники, какие договоры.
- Анализ выборки: проверка типовых источников на предмет прав и лицензий.
- Персональные данные: карта ПДн в датасете, основания, локализация.
- Реестр источников с правовым статусом каждого.
- Рекомендации: что использовать свободно, что с условиями, что заменить; правки договоров и соглашений.
- Опционально — подготовка пользовательского соглашения под ст. 10 ч. 1 (уведомления о правах на генерации с 01.03.2027).
Для небольших команд проверка занимает 1–2 недели; для больших наборов с множеством источников — дольше, но реестр источников можно вести с самого начала проекта, и тогда аудит превращается в сверку, а не расследование.
Кому это нужно в первую очередь
- Разработчикам, обучающим или дообучающим модели на смешанных источниках.
- Продуктам с генерацией (текст, изображения, голос): помимо датасетов — правка соглашений по ст. 10.
- Компаниям со своими контент-активами: двойная роль — и пользователь чужих данных, и правообладатель.
- Госзаказчикам ИИ-решений: запрос карты данных у поставщика — способ защитить закупку.