Что говорит официальный список
Издание OWASP LLM Top-10 2025 года закрепило за дезинформацией отдельную позицию: LLM09 Misinformation — модели создают ложные или вводящие в заблуждение сведения, которые выглядят достоверными. Именно «выглядят» и составляет уязвимость: результат сгенерирован уверенным тоном, в правильной грамматике, с опорой на правдоподобную структуру — и окружающие перестают проверять. Для приложений, принимающих вывод модели без верификации, это прямая уязвимость приложения, а не «особенность технологии».
Два корня одной проблемы
Галлюцинации. Модель генерирует контент, который кажется точным, но сфабрикован: система заполняет пробелы в обучающих данных статистическими паттернами, не понимая содержания. Отсюда — выдуманные цитаты, несуществующие номера дел, точные на вид, но ложные цифры.
Чрезмерное доверие. Пользователи перекладывают на модель ответственность за проверку: ответ выглядит авторитетно — значит, так и есть. OWASP фиксирует это как самостоятельный корень риска: даже аккуратная модель опасна в контуре без верификации.
Усиливают картину смещение обучающих данных и неполнота информации: модель наследует пробелы и предвзятость корпусов.
Четыре класса задокументированных примеров
| Класс | Что произошло |
|---|---|
| Фактические ошибки | Чат-бот авиакомпании Air Canada выдал пассажирам неверную информацию; авиакомпанию засудили |
| Необоснованные утверждения | ChatGPT сфабриковал судебные дела, которые юристы цитировали в суде |
| Ложная экспертность | Чат-боты вводят пользователей в заблуждение по сложным темам, включая здоровье |
| Небезопасный код | Модели предлагают уязвимые или несуществующие библиотеки |
Кейсы показывают главное: ущерб возникает в момент, когда генерация без проверки уходит в действие — в иск, в диагноз, в сборку приложения.
Сценарии атак: когда ложь — оружие
Первый сценарий превращает галлюцинации в вектор вторжения: злоумышленники прощупывают кодогенераторы, собирают наиболее часто галлюцинируемые имена пакетов и публикуют под ними вредоносные пакеты в популярных репозиториях. Разработчик доверяет подсказке ассистента, ставит пакет — и открывает атакующим доступ, инъекции кода или бэкдор. Явление известно как слопсквоттинг: атака не взламывает модель, она использует её правдоподобие.
Второй сценарий обходится без атакующего: медицинский чат-бот с недостаточной точностью выдаёт вредные рекомендации, пациентам наносится ущерб, компанию засуживают. Формула риска: неадекватный надзор плюс доверие к автоматике — и иск уже не про «ИИ», а про вашу организацию.
Восемь групп контрмер по OWASP
- RAG — генерация с опорой на проверенные источники: внешняя база верифицированных данных снижает долю выдумки.
- Дообучение модели: параметрически эффективная настройка и цепочки рассуждений повышают качество вывода.
- Перекрёстная проверка и человеческий надзор: ответы сверяются с доверенными источниками; критичные контуры обслуживают обученные ревьюеры.
- Автоматическая валидация: программные механизмы проверки ключевых выходов, прежде всего в высокорисковых средах.
- Коммуникация рисков: пользователю явно сообщают ограничения системы и риск недостоверности.
- Безопасные практики кода: запрет слепой установки предложенных библиотек, проверка существования и репутации пакетов.
- Дизайн интерфейса: фильтры контента, ясная маркировка сгенерированного, обозначение надёжности.
- Обучение пользователей: независимая проверка, критическое мышление, отраслевые тренинги.
Российский контур
Отечественное регулирование не запрещает галлюцинации, но расходится с ними по касательной: 243-ФЗ от 26.07.2026 требует от разработчиков статусных больших моделей организационных и технических мер безопасности и технической документации с ограничениями модели — по сути, официального признания пределов системы. Для контента закон предоставляет авторам право на информационное предупреждение — добровольное, без штрафных механизмов. Персональные данные в контурах верификации остаются в ведении 152-ФЗ. Практический вывод совпадает с OWASP: фиксируйте ограничения, не пускайте генерацию в критичные решения без проверки, ведите журналы — они же доказательство должной осмотрительности.
Как измерять зрелость контура
Позиция становится управляемой, когда у вас есть три привычки. Регулярная выборочная проверка: часть ответов системы сверяется с первоисточниками по фиксированному расписанию, доля расхождений фиксируется как метрика. Каталог рискованных сценариев: перечень решений, которые нельзя принимать по генерации без человека, — от юридических до медицинских. И журнал инцидентов недостоверности: каждый случай, когда ложный вывод дошёл до пользователя или процесса, разбирается по тем же правилам, что инциденты безопасности. Такая тройка превращает LLM09 из «особенности нейросетей» в обычный операционный риск с владельцем, метрикой и порогами эскалации.