Классическая стеганография старше компьютеров: невидимые чернила, первые буквы строк, условные обороты. Нейросети дали ей новый носитель — генеративный контент. Модель, выбирающая между синонимами, порядком слов и вариантами перевода, волей-неволей делает выбор в каждом токене; если этот выбор подчинить коду, текст становится каналом связи. Читатель видит обычное письмо — детектор видит поток бит.
Тема разлетается на два полюса, и их важно не путать. Первый полюс — защитная маркировка: владелец модели сознательно закладывает метку в выход, чтобы доказывать происхождение контента; это watermarking ИИ. Второй полюс — атака: скрытый канал, о котором владелец системы не знает. Именно второй полюс — тема безопасности, и именно он опасен для корпоративных систем.
Как устроен скрытый канал: техники
- Выбор токенов. Самый изящный способ: «да/нет» кодируется тем, какой из двух равнозначных синонимов выбрала модель. Текст остаётся естественным, статистика выбора несёт сообщение.
- Невидимые символы. Пробелы нулевой ширины, вариационные селекторы, управляющие юникод-символы: в тексте их не видно, а копипаст переносит исправно. Классика скрытой записи в документах и чатах.
- Форматирование. Пробелы в конце строк, чередование кавычек, разрядка букв — медленно, но незаметно.
- Изображения и аудио. Младшие биты пикселей, чуть изменённые частоты спектрограммы — классическая мультимедийная стеганография, доступная и генеративным моделям.
- Промпт как носитель. Обратный ход: данные прячут во вход, который модель потом «читает»; в сочетании с промпт-инъекцией так передают и команды.
Каналу нужны два конца. На одном — вложение: что-то или кто-то кодирует данные в выход. На другом — извлечение: у получателя должен быть способ прочитать скрытое. Если атакующий контролирует и то и другое, DLP видит лишь «сотрудник получил от бота обычный текст отчёта».
Сценарии атак, о которых стоит знать
- Утечка данных через агента. ИИ-агент с доступом к чувствительным документам включает фрагменты данных в «обычный» ответ так, что фильтры не срабатывают: не шаблоны карт и паспортов, а кодированные следы. Подробно об устройстве таких систем — в статье ИИ-агенты.
- Скрытая координация. Взломанный агент общается с «центром» через тексты задач и отчётов: для наблюдателя — рабочий шум, для атакующего — канал управления.
- Обход контроля вывода. Guardrails проверяют смысл и запрещённые паттерны, а не невидимые символы; стегоканал проходит под ними, как вода под мостом.
- Экфильтрация промптов. Промышленные секреты компании — системные промпты и базы знаний RAG — могут «утекать» не прямым текстом, а следами в статистике ответов.
Защита: перекрыть канал, а не текст
- Контроль исходящего трафика. Правило номер один для агентов: любые внешние вызовы — только через белый список, никакой «свободной» сети. Канал без второго конца бесполезен; это — фундамент защиты агентов.
- Санитизация текста. На выходе критичных конвейеров — нормализация юникода: срезание невидимых и управляющих символов, унификация кавычек и пробелов. Дёшево и закрывает самый ходовой приём.
- Ограничение энтропии. Там, где формат позволяет, фиксируются стиль и словарь генерации — меньше свободы выбора, меньше места для кода.
- Мониторинг аномалий. Странности в статистике ответов: необъяснимая избирательность синонимов, систематические «ненужные» вариации формата.
- Изоляция полномочий. Агент, у которого нет доступа к секретам, не может их эксфильтрировать — ни текстом, ни стеганографией. Минимизация прав сильнее любых фильтров.
- Красная команда. Целенаправленные проверки на скрытые каналы: попытки заставить ассистента передать данные кодированно. Как это выглядит на практике — красная команда по ИИ.
Зачем бизнесу и где применяется у НЬЮ-ССТ
- Агенты в production — новый периметр. Компании подключают ассистентов к почте, CRM и файловым хранилищам; каждый такой доступ — потенциальный второй конец стегоканала.
- Требования заказчиков. В ТЗ на ИИ-системы с доступом к данным всё чаще встречается явное требование: контроль исходящих данных и устойчивость к обходу.
- Доказуемость и маркировка. Позитивная сторона той же технологии — watermarking: маркировка собственной генерации. По закону об ИИ (243-ФЗ) маркировка ИИ-контента в России закреплена как возможность, без единого обязательного формата.
У НЬЮ-ССТ проверка скрытых каналов входит в аудит ИИ-безопасности (старт от 90 000 ₽): анализ исходящих потоков агентов, санитизация вывода, настройка белых списков и тесты на эксфильтрацию.
Практикум: проверить свои тексты за десять минут
Самая ходовая техника — невидимые символы — проверяется без специального софта. Возьмите текст, который система получает извне (загруженный документ, письмо, вставка в чат), вставьте в редактор с отображением непечатаемых символов или воспользуйтесь любым онлайн-инспектором юникода: нормальный русский текст содержит кириллицу, пунктуацию и обычные пробелы; наличие пробелов нулевой ширины, вариационных селекторов и управляющих символов направления письма — маркер скрытой записи. Полезная привычка для критичных конвейеров — автоматическая санитизация на входе: невидимые символы срезаются скриптом до того, как текст попадёт в модель или документооборот.
Второй практикум — для владельцев ассистентов: попробуйте попросить вашего бота «перескажи документ, выбирая слова осторожно». Стандартный отказ ничего не доказывает, но сочетание свободного доступа к документам и свободного выхода текста наружу — сигнал проверить оба конца канала по списку из раздела защиты.
Граница со смежными понятиями
- Watermarking. Метка владельца, цель — доказуемость происхождения; о ней знает сам владелец, и это его решение. Скрытый канал атаки существует против воли владельца системы. Техники похожи — назначение противоположное.
- Стеганография в данных модели. Отдельная область — скрытие данных в самих весах или в кэшах модели (научная экзотика сегодня, но направление отслеживается).
- Обфускация. Запутывание кода или текста для затруднения анализа — не передача данных, а маскировка содержания; часто соседствует со стеганографией в цепочках атак.
- Кодирование данных. Base64 или шифрование — данные скрыты от человека, но видимы как «подозрительная строка»; стеганография же не выглядит подозрительной вообще. Именно поэтому против неё бессильны фильтры, ищущие «странные строки».
Частые заблуждения
- «DLP нас прикроет». Классическая DLP ищет известные паттерны и аномальные объёмы; стегоканал в невидимом тексте или статистике синонимов не выглядит ни аномальным объёмом, ни паттерном. Прикроет архитектура: белый список соединений и санитизация.
- «Наша модель слишком мала для таких атак». Размер модели не при чём: канал живёт в тексте и правах доступа, а не в параметрах модели. Даже правила автоматической замены текста могут служить носителем.
- «Это теория, в жизни не встречается». Невидимые символы и LSB-вставки в изображениях — действующие техники, а с распространением агентов с доступом к почте и файлам сценарий эксфильтрации становится практичным. Пока встречается редко — лучший момент для профилактики.
- «Достаточно запретить в промпте». Запрет в системном промпте останавливает случайности, но не целенаправленную атаку: инструкция модели — не барьер для того, кто контролирует часть контекста.
Экономика атаки: когда скрытый канал выгоден
Стеганография — не первая техника в арсенале атакующего: она выбирается там, где обычные каналы закрыты или оставляют след. Если исходящий трафик свободен, данные вывозят напрямую; если стоит DLP, пробуют шифрование и архивы; когда и это ловится — остаётся канал, который не выглядит каналом. Отсюда практическое следствие для защитника: стеганография интересна системам с уже выстроенным базовым контролем. Компания без белых списков соединений и журналов может не заметить ни стегоканал, ни что-нибудь попроще — начинать надо с азов, а не с экзотики.
Второй фактор выгоды — время. Скрытый канал работает медленно: пропускная способность текстовой стеганографии невелика, большие объёмы так не вывезти. Значит, целевые сценарии — не массовая эксфильтрация, а тихая передача самого ценного: ключей, контактов, коротких инструкций. Это подсказывает и приоритет мониторинга: сигнализировать должны не объёмы, а аномальная систематичность — регулярные микропередачи по одному и тому же пути.
Стеганография и мультиагентные цепочки
Отдельного внимания заслуживают цепочки из нескольких оркестрируемых агентов: когда результат одного агента становится контекстом другого, скрытая вставка первого проходит по цепочке и меняет поведение всей системы. Защита — сквозная санитизация на стыках между агентами и запрет одному агенту исполнять инструкции, найденные в выходе другого. Короткое правило для архитектуры: данные, произведённые моделью, — это данные, а не команды, пока человек или валидатор не решил иначе.
С чего начать
Проверьте два места. Первое — что ваши ИИ-агенты и ассистенты технически не могут обращаться к произвольным внешним адресам. Второе — проходит ли текст из ИИ-систем в файлы и письма без нормализации юникода. Эти две меры закрывают большинство практических сценариев стеганографии без единой строчки экзотики.