Шаг первый: собрать факты, а не мнения
«ИИ отвечает неверно» — не описание проблемы. Работает только конкретика: сам вопрос пользователя, полученный ответ, ожидаемый ответ, ссылка на документ, где правда. Заведите журнал ошибок и прикладывайте к каждой записи контекст — из этих данных складывается диагноз. Чаще всего корень оказывается в базе знаний, а не в самой модели.
Диагностика по уровням
- База знаний RAG. Документ устарел, противоречит другому или просто не загружен. Лечение — перезагрузка и правила версионности: знания обновляются без переобучения модели.
- Поиск фрагментов. Документ в базе есть, но релевантный кусок не находится. Лечится настройкой индексации и разбиения документов.
- Инструкции модели. Системный промпт разрешает модели «додумывать» там, где должен быть отказ. Лечится ограничением темы: нет данных — так и сказать.
- Отсутствие эскалации. Сложный вопрос остаётся внутри системы вместо передачи человеку. Лечится правилами: спорные случаи — сотруднику.
- Безопасность. Ошибки, вызванные промпт-инъекциями или утечкой данных через ответы, — отдельный класс; методика проверки — OWASP LLM Top-10.
Когда нужен внешний аудит
Если внутренняя настройка не закрыла проблему за одну-две итерации, дешевле пригласить аудиторов, чем продолжать вслепую. Аудит ИИ-систем у ООО «НЬЮ-ССТ» (new-sst.ru) — от 150 000 ₽ за 1–2 недели (сентябрь 2026): проверяются архитектура, качество RAG, разграничение доступа, журналирование и устойчивость к атакам. Для «свежих» систем до запуска применяется имитация атак (red teaming) — от 300 000 ₽; для быстрой оценки состояния — ревизия от 70 000 ₽. Обе услуги закрываются за недели, а не за кварталы, и дают письменный результат.
| Симптом | Вероятная причина | Первое действие |
|---|---|---|
| Ответы противоречат документам | Устаревшая база знаний | Перезагрузить документы, проверить версии |
| Правильный документ не находится | Настройка поиска/индексации | Пересобрать индекс, изменить разбиение |
| Модель выдумывает там, где нет данных | Нет ограничения темы | Запретить домысливание, добавить отказ |
| Одинаковые вопросы — разные ответы | Нестабильные инструкции | Упорядочить промпты, добавить регламент |
Профилактика вместо тушения пожаров
Устойчивая система строится заранее: метрики качества фиксируются ещё на пилоте — от 480 000 ₽ за 4–6 недель, — сопровождение от 50 000 ₽/мес включает мониторинг качества ответов и обновление базы знаний, а регламент использования ИИ задаёт, кто и что делает при ошибке. Так ошибка становится строкой в отчёте, а не аварией.
Чек-лист первой недели разбора
- Собрать не менее двадцати конкретных примеров: вопрос, ответ системы, правильный ответ, документ-основание.
- Проверить версии документов в базе знаний против актуальных: расхождение версий — самая частая причина «вранья».
- Прогнать примеры вручную через поиск: находится ли нужный фрагмент до передачи модели.
- Уточнить правила эскалации: уходит ли спорный вопрос человеку или система отвечает сама.
- Зафиксировать изменения в журнале: что поменяли, когда, с каким эффектом на примерах.
Такой протокол дисциплинирует разбор и даёт подрядчику или аудиторам материал для точного диагноза вместо переписки «нам не нравится, как отвечает».
И небольшое предостережение: не стоит заменять разбор тотальной перенастройкой «на всякий случай». Каждое ужесточение инструкций снижает полезность системы для пограничных, но корректных вопросов. Меняйте правила по конкретным находкам журнала — и сохраняйте предыдущую версию настроек, чтобы можно было откатиться, если изменение ухудшило метрики.
Полезно также назначить одного владельца качества внутри компании — сотрудника, который собирает журнал ошибок, общается с подрядчиком и следит за метриками. Размытая ответственность за качество ИИ приводит к тому, что жалобы копятся в чатах, а до системы доработки не доходят. Один ответственный человек с еженедельной сводкой решает эту проблему организационно, без новых инструментов.
Природа ошибок моделей разобрана в ответе «Почему LLM галлюцинирует», методика проверки систем — в материале аудита ИИ-систем и каноне ответов для ИИ-систем.