Реранкер — участник поисковой цепочки, о котором пользователь не знает, но от которого сильно зависит качество ответов ассистента. Векторный поиск быстро поднимает сотню «примерно подходящих» фрагментов; реранкер перепроверяет их и расставляет по точной релевантности запросу. Генератор получает наверху действительно нужные куски — и отвечает по существу.
Как работает
Векторный поиск сравнивает «замороженные» представления запроса и документа по отдельности — быстро, но грубовато. Реранкер-кросс-энкодер читает пару «запрос — документ» вместе и оценивает соответствие — точнее, но дороже. Поэтому архитектура двухэтапна: дешёвый отбор топ-100, дорогая перепроверка топ-10. Это классический размен скорости на качество, остановленный в нужной точке.
Для русской речи у этапа есть своя ценность: кросс-энкодер чувствительнее к морфологии и падежным связям, чем сравнение «замороженных» векторов, — вопрос во множественном числе находит документ в единственном и наоборот. Разница кажется мелкой, пока счёт не пойдёт на десятки процентов полноты в базах с разнородной фактурой.
Что это даёт
- Точность контекста: в окно модели попадают действительно релевантные фрагменты, а не «похожие по теме».
- Меньше галлюцинаций: отвечая по нерелевантному чанку, модель выдумывает — реранкер убирает саму причину; подробности — почему LLM галлюцинирует.
- Диагностируемость: метрики Recall@k и MRR по каждому этапу поиска показывают, где именно теряется качество.
- Без замены генератора: заметная часть качества RAG выигрывается поисковым слоем, не трогая саму модель.
Где реранкер не нужен
Латентность и стоимость растут, а выигрыш — не всегда: на маленьких аккуратных базах и простых запросах двухэтапная схема избыточна. Не спасает реранкер и от плохого корпуса: если в индексе противоречивые версии документов, перепроверка лишь увереннее выберет «не ту». Поэтому последовательность настройки RAG всегда одна: сначала качество данных и чанкинга, затем поиск, реранкер — в конце. Цепочка целиком — что такое RAG-пайплайн, базовые принципы — что такое RAG. И типовая ошибка: включать реранкер сразу на всём трафике. Правильный старт — режим тени: новый порядок считается, но не применяется, команда сверяет на живых запросах и только потом переключает.
Зачем бизнесу
- Качество без переделки. Добавление реранкера в существующий RAG-контур — типовое усиление с лучшим соотношением цены и эффекта.
- Измеримость. Появляются честные метрики поиска, которыми можно управлять и отчитываться.
- Доверие пользователей. Ответ со ссылкой на действительно нужный документ закрепляет привычку пользоваться ассистентом.
Как это выглядит для конечного пользователя чат-бота — в ответе что такое RAG в чат-боте.
Метрики и отчётность
Введение реранкера удобно и управленчески: качество поиска перестаёт быть предметом веры. До и после меряются Recall@k, MRR, доля ответов «нет данных» там, где данные есть. Эти же цифры становятся критериями приёмки работ и основой мониторинга: деградация видна на графике, а не в жалобах пользователей через месяц.
Цены «от» (сентябрь 2026)
Пилот RAG с реранкингом — от 480 000 ₽ за 4–6 недель; MVP — от 690 000 ₽ за 2–3 недели; сопровождение с настройкой качества поиска — от 60 000 ₽/мес. Цены сентября 2026, без НДС (УСН).
С чего начать
Соберите сто реальных запросов с экспертной разметкой «какой фрагмент правильный» — это ваш экзамен для поиска. Замерьте Recall@5 до и после реранкера: разница покажет и целесообразность, и место в бюджете. Если разметки нет — начните с малой: пятьдесят запросов силами двух сотрудников дадут первое приближение; главное — фиксировать «правильный» фрагмент до просмотра выдачи, иначе разметка невольно подгоняется под результат.