Механика атаки
У модели нет кнопки «скачать веса» — но её не нужно скачивать, чтобы украсть. Атакующий генерирует тысячи разнообразных запросов, сохраняет ответы и обучает на этих парах собственную модель-ученика. Через достаточное число примеров копия повторяет поведение оригинала: стиль, знания домена, решения. Для компании это потеря интеллектуальной собственности, оплаченной пилотами и экспертизой, — без единого взлома сервера.
Семейство смежных атак добирает остальное: инверсия пытается восстановить сами обучающие примеры по ответам, membership inference — определить, участвовал ли конкретный объект в обучении. В корпоративном контуре всё это читается одинаково: через открытый интерфейс из системы вытягивается то, что должно было остаться внутри.
Кто в группе риска
Первая группа — модели, доступные через публичный API без квот и контроля частоты. Вторая — ассистенты с уникальной базой знаний: даже скопировав поведение общей модели, атакующий через ваши же ответы вытягивает фрагменты вашей базы. Третья — нишевые классификаторы (скоринг, маршрутизация заявок): их логика восстанавливается малым числом запросов, ведь пространство ответов узкое. Отдельный случай — модели, обслуживающие платный продукт: когда ответы системы и есть товар, копирование поведения бьёт по выручке напрямую, и к техническим мерам добавляется договорная неустойка за выкачивание API.
Признаки разворачивающейся атаки
- Ровный поток запросов круглые сутки, без суточной ритмики живых пользователей.
- Систематический перебор: однотипные запросы с малыми вариациями, обход словаря по алфавиту.
- Игнорирование ответов: одни и те же вопросы повторяются — важен сам факт ответа, а не содержание.
- Рост расходов на токены и деградация скорости для честных пользователей.
Профиль такой активности совпадает с классом злоупотреблений ресурсами — их разбор в карточке OWASP LLM10 о неограниченном потреблении.
Контрмеры
Технический слой: жёсткие квоты на ключ и на аккаунт, ограничение частоты, разрыв сессий при паттерне перебора, отдельные лимиты для анонимного контура. Скрытый слой — водяные знаки: в ответы мягко встраиваются статистические маркеры, по которым скопированная модель доказуемо происходит от вашей. Юридический слой — модель и промпты закреплены как объекты интеллектуальной собственности в договоре, API-условия прямо запрещают автоматизированную выгрузку. Проверьте действующий договор: в части условий провайдеров запреты на автоматизированный сбор ответов уже прописаны — их стоит процитировать в претензии при первом инциденте. Отличие от утечки данных из модели — в предмете кражи: там тянут содержимое ответов, здесь — саму способность их давать; про первый сценарий читайте в разборе защиты модели от утечки данных.
Чек-лист на сегодня
Пять проверок, которые делаются за один вечер. Есть ли квоты на каждый ключ и на каждый анонимный канал. Логируются ли отклонённые запросы с превышением частоты. Отличается ли поведение живых пользователей от ровного роботизированного потока — и виден ли этот контраст на дашборде. Заведён ли алерт на аномальный рост расходов на модель. Прописано ли в договоре с разработчиком, кому принадлежит модель и её настройки.
Если хотя бы два пункта провалены, контур дешевле защищать сейчас — до того, как аномальный трафик обнаружится счётом от провайдера.
Водяные знаки на практике
Идея маркеров проста, реализация тонка: маркер должен переживать копирование, не портить качество ответов и доказуемо указывать на источник. Поэтому зрелые внедрения не изобретают схему с нуля, а используют проверенные библиотеки и тестируют устойчивость на реальных выборках. Крупные платформы двигаются к стандартам маркировки генераций и в законодательном поле — техвозможность маркировки у больших платформ появляется по 243-ФЗ с 1 марта 2027 года.
Для небольшой компании прагматичный старт — маркеры в служебных полях ответов API и канареечные фрагменты в базе знаний: дёшево, заметно и доказуемо.
Оценить устойчивость контура к переборным атакам помогает аудит ИИ-систем в объёме OWASP LLM Top-10 — от 150 000 ₽ за 1–2 недели у ООО «НЬЮ-ССТ» (new-sst.ru), сентябрь 2026; для критичных активов — заказ red teaming (от 300 000 ₽).