Что такое синтетические данные
Синтетические данные — записи, сгенерированные алгоритмом, а не взятые из реальности: клиенты, которых не существует, транзакции, которые не происходили, документы, которые никто не подписывал. Ценность в том, что при правильной генерации они воспроизводят статистические свойства реального массива: распределения значений, корреляции между полями, частоту редких категорий, временны́е паттерны. Для задачи «нужны данные для теста/демо/прототипа» это ответ без персональных данных — по построению, а не «мы надеемся, что обезличили».
От маскирования синтетика отличается принципиально: маскирование изменяет реальные записи (сохраняя их структуру и риски ре-идентификации редких комбинаций), генерация создаёт новые записи, которых в реальности нет. Оба подхода — из одного инструментального семейства защиты данных; их сочетания и границы разобраны в материалах про анонимизацию для LLM и дифференциальную приватность.
Где применяется
- Тестирование и приёмка: полноценные прогоны интеграций 1С/порталов/ИИ-сервисов на данных без единой персональной записи; UAT-контуры для заказчика без рисков.
- Демонстрации и пилоты: показ систем на «живых» данных без передачи реальных массивов подрядчикам и стейкхолдерам.
- Прототипы и разработка: команды работают в средах разработки с реалистичными данными — ошибки ловятся раньше, доступы не нужны.
- Обучение и augmentation: дополнение редких классов (мошеннические операции, редкие дефекты) синтетическими примерами.
- Нагрузочное тестирование: генерация потоков событий нужного объёма и профиля для нагрузочных испытаний инфраструктуры.
Методы: от генераторов значений до GAN
Спектр методов широк — от простых к сложным. Открытая библиотека Faker генерирует реалистичные значения отдельных полей: имена, адреса, компании, номера — хороша для «наполнения» систем. Табличная генерация с сохранением многомерных зависимостей — домен GAN-подходов: модели семейства CTGAN и родственные алгоритмы обучаются на реальной таблице и выдают новые строки с похожей структурой связей. Значительная часть этой экосистемы исторически жила в проекте SDV (Synthetic Data Vault), но здесь важен лицензионный поворот: SDV распространяется по Business Source License 1.1 — это не классический open source: использование ограничено, полные права «открываются» только по истечении change date каждой версии. Для встроенного коммерческого использования — читать условия и/или выбирать альтернативы до старта, а не после. Тексты и документы генерируются LLM: плановые сценарии, договорные формы, обращения с нужной тональностью — с пост-проверкой на утечку реальных фраз.
Полезность и приватность: две проверки
Качество синтетического набора меряется в двух осях, и обе обязательны. Полезность (fidelity): насколько синтетика похожа на оригинал по делу — совпадение распределений ключевых полей, сохранение корреляций, доля редких категорий, поведение аналитических моделей, обученных на синтетике, против обученных на реальных данных. Приватность: не «зазеркалила» ли генеративная модель реальные записи — GAN-генераторы склонны копировать редкие уникальные примеры, и такой «синтетический» клиент де-факто является реальным человеком. Проверки: поиск ближайших соседей синтетических записей к реальным, атаки членства (определить, использовалась ли конкретная запись при обучении генератора). Формальную границу здесь даёт дифференциальная приватность: генератор, обученный с DP-гарантией, даёт доказуемую защиту ценой некоторой потери точности воспроизведения.
Как применяем: этапы
- Анализ оригинала. Схема, распределения, связи, чувствительные поля; что именно обязана воспроизвести синтетика для вашей задачи (обычно 10–20 ключевых свойств, а не «всё»).
- Выбор генератора. Faker для наполнения, табличные GAN для зависимостей, LLM для текстов; лицензионная карта фиксируется до разработки.
- Обучение и генерация. Обучение на реальных данных в защищённом контуре; выпуск синтетического набора нужного объёма.
- Проверка полезности. Метрики совпадения распределений и связей; при необходимости — сравнение моделей, обученных на синтетике против реальных данных.
- Проверка приватности. Ближайшие соседи, атаки членства; для строгих требований — DP-генератор.
- Ввод в эксплуатацию. Регламент обновления (реальные данные дрейфуют — синтетика перегенерируется), документация и хранение артефактов проверки.
Текстовая схема: реальные данные (защищённый контур) → обучение генератора (Faker/CTGAN/LLM, лицензии проверены) → синтетический набор → метрики полезности + проверки приватности → среды разработки/тестов/демо.
| Формат | Цена | Срок |
|---|---|---|
| Анализ данных и требования к синтетике | от 90 000 ₽ | 1–2 недели |
| Пилот: генератор + метрики полезности и приватности | от 480 000 ₽ | 4–6 недель |
| Промышленный контур: регламенты, перегенерация | от 690 000 ₽ | 3–5 недель |
| Расширенный контур: DP-генератор, атаки членства | 0,9–1,2 млн ₽ | 6–8 недель |
Лицензии: проверять до встраивания
Юридическая деталь, которая регулярно стреляет: инструменты генерации живут под очень разными лицензиями. Faker — открытая библиотека с широкой permissible-лицензией; SDV — Business Source License 1.1 с ограничением коммерческого использования до change date; LLM-генерация — лицензии самих моделей (про открытые модели — наш материал про open-source LLM для бизнеса). Мы фиксируем лицензионную карту генератора в проектной документации до выбора стека — чтобы заказчик не обнаружил ограничение после инвестиций в интеграцию.
Тонкости, которые всплывают в проектах
Первая — «похоже» не значит «годно»: синтетика с правильными распределениями, но сломанными бизнес-правилами (отрицательные возрасты, невозможные связки статусов) выдают себя на интеграционных тестах; бизнес-правила валидируются отдельно. Вторая — редкие события: генератор сглаживает хвосты распределений именно там, где сосредоточена ценность (мошенничество, редкие дефекты); хвосты контролируются отдельными настройками и проверками. Третья — дрейф: реальные данные меняются, синтетика, сгенерированная год назад, перестаёт быть реалистичной — перегенерация ставится на регламент. Четвёртая — ожидания аналитиков: синтетика годится для разработки и тестов, но делать на ней финальные бизнес-выводы («а сколько у нас действительно клиентов в сегменте X») нельзя — для аналитики нужны реальные данные с корректным контуром доступа. Пятая — документирование генезиса: каждый синтетический набор сопровождается паспортом — на чём обучен генератор, когда перегенерировался, какие проверки прошёл; без паспорта через полгода никто не ответит, можно ли этому набору ещё доверять.
Кейс: контур тестирования без персональных данных
Типовой проект выглядит так. Заказчик внедряет ИИ-сервис на данных клиентов; команде разработки и тестирования нужны данные окружения, но доступ к реальным записям согласовать нельзя — ни по срокам, ни по политике. Мы анализируем структуру реальных данных (в защищённом контуре, без выгрузки самих записей наружу), обучаем генератор, выпускаем синтетический набор в десятки тысяч записей с сохранением ключевых распределений — и дальше разработка, интеграционные тесты и приёмка идут на нём.
Что это даёт по итогам: тесты находят проблемы, которые не видны на самодельных выборках (связки полей, редкие категории, объёмы); демонстрации заказчику идут на реалистичных данных без единой персональной записи; доступы разработчиков к чувствительным системам не нужны вообще — меньше согласований и рисков. А когда приходит пора настоящих данных, синтетический контур остаётся как стенд регрессии: обновления систем проверяются на нём до продуктивной среды.
Как стартуем
- Опишите структуру данных и сценарии использования — за 1–2 недели соберём требования к синтетике (что обязана воспроизводить, что — нет).
- Пилот: генератор, метрики полезности, проверки приватности, лицензионная карта — от 480 000 ₽ за 4–6 недель.
- Внедрение в среды разработки/тестов и регламент перегенерации — по результатам пилота.
Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.