Качество RAG-ассистента на 80% определяется качеством данных: модель отвечает ровно так хорошо, как устроена база знаний. Что такое RAG, мы разбирали в словарной статье; здесь — практический порядок подготовки данных от первого аудита до регламента обновления.
Порядок ниже повторяет производственный конвейер НЬЮ-ССТ при подготовке RAG-проектов: на корпусах до нескольких сотен документов он занимает считанные дни, а экономит недели отладки. Отдельный аудит процессов и данных стоит от 90 000 ₽ и длится 3–5 рабочих дней — но базовую подготовку заказчик вполне делает самостоятельно по этой инструкции. Чем чище корпус на входе, тем честнее метрики пилота на выходе.
Пошаговый план
Проведите инвентаризацию источников
Выпишите все документы, которые должны попасть в базу знаний: регламенты, инструкции, стандарты, типовые ответы, договорные шаблоны. Для каждого укажите владельца, дату актуальности и формат. На выходе — реестр источников, с которым удобно работать дальше. Владелец источника — тот, кто отвечает за его актуальность, а не просто хранит файл.
Очистите и дедуплицируйте
Уберите устаревшие редакции, черновики и дубликаты — противоречивые версии одного документа главная причина неверных ответов ассистента. Сведите всё к одному актуальному источнику истины по каждой теме. Признак хорошей очистки: по каждой теме остаётся ровно один документ-источник.
Классифицируйте по персональным данным
Просмотрите корпус на персональные данные и коммерческие тайны. Если фрагмент не нужен для ответов — исключите его; если нужен — обезличьте или предусмотрите разграничение доступа. Обучать и «скармливать» модели сырые персональные данные без правового основания нельзя — подробности в разборе ограничений. Спорные фрагменты выносите в отдельный список и решайте по каждому явно.
Нарежьте документы на фрагменты
Разбейте тексты на логические блоки так, чтобы каждый фрагмент был самодостаточным для ответа: раздел, пункт, вопрос-ответ. Правильная нарезка влияет на точность поиска сильнее, чем выбор модели — этапы конвейера разобраны в статье про RAG-пайплайн. Оптимальный фрагмент умещает и вопрос, и ответ целиком, без «прыжков» между блоками.
Выполните векторную индексацию
Загрузите фрагменты в векторное хранилище — это техническая часть, которую берёт на себя подрядчик. Скорость сопоставима с кейсом ИИ-ассистента конференции от НЬЮ-ССТ, где RAG-индексация материалов занимает до 5 минут. Доступ к загрузке ограничьте одним-двумя ответственными — иначе в базе снова появится хаос.
Прогоните тестовые вопросы
Соберите 30–50 реальных вопросов пользователей и проверьте, что система находит нужные фрагменты и отвечает корректно. Ошибки поиска — сигнал доработать нарезку или очистить противоречия в источниках. Сравнить подход «поиск по базе» с дообучением модели поможет сравнение RAG и дообучения. Набор тестовых вопросов сохраните: он пригодится после каждого обновления базы.
Опишите регламент обновления
Зафиксируйте, кто, как часто и как добавляет новые документы и архивирует устаревшие. Главный плюс RAG — обновление базы простой перезагрузкой документов, без переобучения модели; регламент делает это преимущество постоянным. Даты актуальности документов фиксируйте в реестре источников — это упростит будущий аудит.
Частые ошибки
Все четыре ловушки подготовки корпуса встречаются в каждом втором RAG-проекте — отметьте, какие из них есть у вас уже сейчас.
- «Загрузим всё, потом разберёмся». вместе с полезными документами в базу попадают устаревшие версии и коммерческие тайны; поиск начинает путаться в противоречиях
- Дубликаты вместо актуальной версии. два похожих фрагмента дают противоречивые ответы; актуальность важнее полноты
- Нарезка «по N символов». механическая нарезка рвёт смысл посередине мысли; фрагменты должны совпадать с логическими блоками документа
- ПДн в базе без основания. персональные данные попадают в ответы ассистента всем пользователям; это прямое нарушение 152-ФЗ
Инструменты и сроки
Для прохождения плана достаточно перечисленных инструментов; ориентир по времени — 3–5 рабочих дней на корпус объёмом до нескольких сотен документов. Сомневаетесь в качестве корпуса — закажите отдельный аудит данных: от 90 000 ₽ и 3–5 рабочих дней по открытому прайсу НЬЮ-ССТ. Аудит покажет и дубли, и проблемные фрагменты, которые вы могли пропустить. Небольшой вычищенный корпус всегда работает лучше большой неструктурированной свалки.
- Реестр источников данных
- Скрипт очистки дубликатов
- Набор тестовых вопросов
Что получится в итоге
Грамотно подготовленный корпус — это база, в которой каждый ответ ассистента прослеживается до конкретного документа-источника. Пилот на таком корпусе показывает честные метрики точности, а обновление знаний дальше занимает часы: положили новый регламент, перезагрузили индекс — без переобучения модели и повторных платежей за дообучение. Именно за это свойство RAG и выбирают вместо дообучения в большинстве корпоративных проектов 2026 года. Если же понадобятся стиль компании или узкие классификации — всегда возможен гибрид из двух подходов.