В словаре уже есть статья «Что такое RAG» — о методе в целом. Здесь — техника: из каких этапов состоит контур и на каких из них теряется качество. Понимание пайплайна отличает осознанное внедрение от «подключили базу и надеемся»: почти каждая проблема ответов диагностируется на конкретном шаге цепочки, а лечится точечно.
Этапы пайплайна
- Загрузка и парсинг. PDF, DOCX, таблицы и сканы превращаются в текст; для сканов подключается OCR или визуально-языковая модель.
- Чанкинг. Документы режутся на фрагменты с перекрытием; размер — компромисс между точностью поиска и полнотой контекста.
- Эмбеддинги. Каждый фрагмент переводится в вектор — «отпечаток смысла».
- Векторный индекс. Векторы складываются в векторную базу для быстрого поиска.
- Retrieval. По вопросу пользователя отбираются top-k ближайших фрагментов.
- Реранкинг. Отдельная модель уточняет порядок кандидатов по релевантности.
- Генерация. Найденные выдержки подаются в промпт: «ответь, опираясь только на них».
- Контроль. Порог релевантности, отказ при пустой выдаче, фильтрация фрагментов по правам пользователя.
Восемь шагов выполняются за секунды; пользователь видит только итог — ответ и ссылку на источник.
Где теряется качество
Классические провалы: таблицы, разъезжавшиеся при парсинге; слишком крупные или мелкие чанки; устаревшие дубли документов в базе; отсутствие реранкинга, когда «близкие по смыслу» фрагменты вытесняют точные. Отдельный класс рисков — безопасность векторного хранилища: отравление индекса и утечки через поиск (см. OWASP LLM08).
Диагностика идёт от симптома к этапу: «не находит то, что есть» — смотрим чанкинг и эмбеддинги; «находит, но отвечает мимо» — реранкинг и сборку промпта; «отвечает по отменённому документу» — регламент обновления базы; «показывает лишнее» — фильтр прав. Такой разбор экономит недели слепой настройки параметров наугад.
Зачем бизнесу
- Предсказуемое качество: каждый шаг пайплайна измеряется и настраивается отдельно.
- Свежесть знаний: обновление — перезагрузка документов, без переобучения модели.
- Аудит: ответ всегда сопровождается фрагментом-источником.
- Права доступа: пользователь видит только те фрагменты, которые ему разрешены.
Для закупщика или службы безопасности это же свойство превращается в аргумент: систему можно «показать изнутри» — продемонстрировать, по какому документу получен ответ и почему пользователь не увидел закрытый раздел. Немаловажно и наследование прав: фильтрация на этапе выдачи кандидатов означает, что секретный документ физически не доходит до модели, а не просто скрывается в интерфейсе.
Метрики пайплайна
- Recall@k: доля контрольных вопросов, для которых нужный фрагмент попал в отобранные k кандидатов.
- Точность ответа: совпадение с эталоном на контрольном наборе — главная метрика качества.
- Доля отказов: как часто система честно говорит «данных нет» вместо выдумки.
- Задержка: время от вопроса до ответа; складывается из поиска, реранкинга и генерации.
Метрики настраиваются по этапам: если Recall низкий — проблема в чанкинге или эмбеддингах, если recall высокий, а точность нет — виновата генерация или подача контекста. Без такого разделения «улучшение RAG» превращается в бессистемное перебирание настроек.
Цены «от» (сентябрь 2026)
Пилот LLM+RAG на одном процессе — от 480 000 ₽ за 4–6 недель; MVP ИИ-ассистента с RAG — от 690 000 ₽; полный промышленный контур — 0,9–1,2 млн ₽; сопровождение — от 50 000 ₽/мес. Цены сентября 2026, без НДС (УСН).
С чего начать
Один процесс, 50–100 контрольных вопросов с эталонными ответами, замер доли точных ответов после настройки каждого этапа. Такой пилот даёт управляемый рост качества вместо надежд на «само научится», а его результаты переезжают в промышленный контур без потерь.