Датасет — одновременно актив и мишень
Качество модели определяется данными, на которых она училась, поэтому набор данных — дорогой актив: в нём месяцы разметки и экспертиза компании. Одновременно это мишень: кража датасета обесценивает работу, отравление — заставляет переобучать всё заново, а персональные данные внутри корпуса превращают технический артефакт в юридическую проблему. Классификация подходов к обучению и его рискам — в статье об обучении модели.
Четыре риска и контрмеры
| Риск | Последствие | Контрмера |
|---|---|---|
| Отравление данных | Модель систематически ошибается или срабатывает по триггеру | Контроль источников, проверка выборок, хэш-суммы версий |
| Кража корпуса | Конкурент получает вашу экспертизу бесплатно | Доступ по ролям, хранение в контуре, запрет выгрузок |
| Персональные данные внутри | Нарушение 152-ФЗ, модель «запоминает» субъектов | Очистка и обезличивание до включения в корпус |
| Несанкционированные правки | Тихая деградация качества без следов | Версионирование, журнал изменений, отдельные окружения |
Механика отравления как класса атак подробно разобрана в карточке угрозы OWASP LLM04 — с примерами того, как вредоносные примеры проходят в корпус через открытые источники и краудсорс-разметку.
Цепочка поставки данных
Корпус редко собирается из одного источника: открытые датасеты, купленные наборы, данные подрядчиков, краудсорс-разметка. Каждый посредник — точка, где данные могли быть получены без прав или изменены. Минимум контроля: лицензия на каждый внешний источник, фиксация версии и контрольной суммы при получении, запись о поставщике. Для разметки — выборочная перепроверка и статистический контроль качества.
Отдельно — право на удаление: если субъект попросил стереть свои данные, из базы знаний они изымаются просто, а из обучающего корпуса — только до обучения. Это ещё один аргумент держать чувствительные данные в RAG, а не в весах модели.
Порядок работ над корпусом
Первый шаг — происхождение: на каждый источник фиксируются право использования (лицензия, договор, собственные данные) и ограничения. Второй — очистка: из корпуса удаляются или обезличиваются персональные данные, реквизиты, тайна третьих лиц; почему обучать модель на персональных данных без правового основания нельзя — отдельный разбор в ответе «Почему нельзя обучать LLM на персональных данных». Пустые и дублирующие записи чистятся до обучения: знаний они не добавляют, но замедляют и удорожают каждый прогон. Заранее оцените и время жизни корпуса: знания в нём устаревают так же, как документы, поэтому дата сбора фиксируется в паспорте, а устаревшие версии снимаются с использования — по аналогии со старыми регламентами. Третий — доступ: корпус лежит в закрытом контуре, права на чтение и изменение разделены, каждая версия датасета сопровождается хэш-суммой и журналом изменений. Четвёртый — приёмка: перед обучением выборка проверяется вручную на предмет аномалий и странных паттернов.
По каждому корпусу ведётся паспорт: источники и права, объём, даты сбора, методы очистки, версии. Паспорт обновляется при каждой доначистке; версия корпуса и версия модели связываются записью — иначе расследование инцидентов превращается в гадание. Без паспорта невозможно доказать законность происхождения данных при споре или запросе регулятора.
Альтернатива, которая снимает половину рисков
Для большинства корпоративных задач обучение не нужно: RAG-контур держит знания в базе компании под управляемым доступом, обновляется перезагрузкой документов и не «запекает» данные в веса модели. Решение о дообучении фиксируется документом — задача, данные, ожидаемый эффект: иначе через год никто не вспомнит, зачем модель переучивали. Обучение оправдано, когда нужны стиль компании или узкие классификации — и тогда корпус заслуживает режима не мягче, чем у продакшн-базы.
Если обучение всё же необходимо, корпус проходит те же ворота, что и рабочие данные: основание, минимизация, сроки. Разница лишь в том, что ошибку после обучения можно исправить только переобучением — дешевле не ошибаться на входе.
Аудит датасета и пайплайна подготовки данных входит в ИИ-аудит (OWASP LLM Top-10) — от 150 000 ₽ за 1–2 недели у ООО «НЬЮ-ССТ» (new-sst.ru), сентябрь 2026; подготовка данных к внедрению ИИ разобрана в ответе «Как подготовить данные для внедрения ИИ».