Короткий ответ на вопрос «что выбрать» мы давали в FAQ «RAG или дообучение модели». Эта страница — инженерное продолжение: сравнение технологий таблицей и расчёт совокупной стоимости владения на три года.
Таблица технологий
| Критерий | RAG | Fine-tuning |
|---|---|---|
| Что меняется | база знаний рядом с неизменной моделью | веса самой модели |
| Обновление знаний | перезагрузкой документов, минуты | новым обучением, дни и недели |
| Прослеживаемость | ответ ссылается на документ-источник | источник ответа не виден |
| Вход по данным | документы как есть | датасеты пар «вопрос — эталон» |
| Эффект | факты, актуальность, цитируемость | стиль, формат, узкие классификации |
| Риски | качество поиска и нарезки | катастрофическое забывание, регрессии |
TCO на три года
| Статья затрат | RAG | Fine-tuning |
|---|---|---|
| Вход | пилот от 480 000 ₽ за 4–6 недель | датасет + обучение + валидация: дороже и дольше |
| Обновление знаний | перезагрузка документов, почти бесплатно | каждое существенное изменение — новый цикл обучения |
| Инфраструктура | векторное хранилище и обычный инференс | GPU для обучения плюс инференс |
| Контроль качества | метрики поиска и реранкинга | регрессионное тестирование после каждого цикла |
Методика расчёта полной стоимости — в материале «TCO собственного LLM»: подставьте свои объёмы документов и частоту изменений.
Чек-лист выбора
- Как часто меняются знания — чаще раза в месяц: RAG, потому что перезагрузка документов дешевле переобучения.
- Нужен ли источник в ответе — регуляторика и внутренний аудит почти всегда требуют ссылку на документ: RAG.
- Есть ли готовый датасет — сотни пар «вопрос — эталонный ответ»: без них fine-tuning не стартует вовсе.
- Требования к стилю — жёсткий тон и формат компании: кандидат на дообучение после исчерпания промптов.
- Бюджет GPU — обучение требует видеокарт на часы и дни, инференс RAG обходится обычным контуром.
- Кто тестирует регрессии — после каждого цикла дообучения нужна полная проверка выборки; нет процедуры — нет fine-tuning.
Порядок действий у зрелых команд одинаковый: RAG и промпты до потолка, тонкая настройка — только под измеримый, а не эстетический эффект.
Когда без fine-tuning не обойтись
- Стиль компании: тон и формат ответов, который не получить промптами.
- Узкие классификации: специфические категории с большим числом примеров.
- Жёсткие задержки: когда нельзя тратить токены на длинный контекст.
В остальных случаях порядок тот же: сначала RAG и промпты, fine-tuning — только когда упёрлись в потолок. Хранилище для RAG-контура выбирается в сравнении «Milvus или Qdrant»; внедрение — услуга LLM-интеграции и RAG.