Два пути «обучить на своих документах»
Когда заказчик говорит «дообучите модель на наших документах», он почти всегда хочет одного: чтобы ассистент отвечал фактами компании — регламентами, договорами, каталогом. Технически это делается двумя принципиально разными способами, и выбор между ними определяет цену, сроки и риски проекта. Первый — RAG (retrieval-augmented generation): документы раскладываются в векторную базу, модель при каждом вопросе находит нужные фрагменты и отвечает по ним. Веса модели не меняются. Второй — fine-tuning: модель фактически дообучается на подготовленном датасете примеров «вопрос — правильный ответ». Веса меняются, модель «запоминает» стиль и формат; результат — файл весов, который нельзя отредактировать руками, а можно только переобучить на новой версии датасета — отсюда и более длинный цикл изменений.
Пошаговая методика обучения на документах компании — в ответе как обучить LLM на документах компании; здесь — правая и ценовая сторона вопроса «можно ли».
Что выбрать: сравнение без маркетинга
| Критерий | RAG | Fine-tuning |
|---|---|---|
| Скорость запуска | прототип 3–5 дней от 90 000 ₽ | недели на датасет и обучение |
| Обновление знаний | загрузил новый документ — сразу отвечает | требует переобучения |
| Прослеживаемость ответа | ссылка на фрагмент документа | ответ «из головы», источник не виден |
| Стиль и формат ответов | задаётся промптом | сильная сторона — устойчивый стиль |
| Риск утечки содержания | контур под контролем, документы можно изъять | содержание «вшито» в веса, изъять нельзя |
Развёрнутое сравнение — в материале RAG против fine-tuning — что выбрать. Практический вывод индустрии: 80–90% бизнес-задач закрываются RAG, fine-tuning подключают для специфических форматов и стиля, когда промптов уже мало.
Правовая рамка: что можно, что нельзя
Документы бывают разные. Регламенты, инструкции, каталоги, публичная документация — обучать и загружать можно свободно, это ваши знания. Персональные данные — нельзя без правового основания: для обработки нужно согласие субъекта или иное законное основание по 152-ФЗ, а для передачи в обучение внешнему сервису — отдельная история с локализацией и поручением обработки. Коммерческую тайну в облачный контур не отдают вообще без NDA и договорного запрета обучения на ваших данных. Подробно правовой разбор — в ответе почему нельзя обучать LLM на персональных данных.
Как готовить документы
- Инвентаризация: собрать документы, разложить по процессам, выкинуть устаревшие версии — модель, обученная на двух редакциях регламента, отвечает случайно то одной, то другой.
- Чистка: удалить ПДн там, где они не нужны для ответа, или обезличить; пометить конфиденциальные блоки.
- Структура: для RAG документы нарезаются на фрагменты — качество нарезки сильно влияет на качество ответов.
- Тестовая выборка: 50–100 реальных вопросов с эталонными ответами — без неё вы не докажете, что «дообучение» сработало.
Сколько это стоит
Вход в RAG — аудит процессов и данных от 90 000 ₽ и прототип от 90 000 ₽ за 3–5 дней: вы проверяете на своих документах, что ассистент отвечает по делу. Дальше MVP — от 690 000 ₽ за 2–3 недели, пилот на процессе — от 480 000 ₽ за 4–6 недель. Услуга целиком — на странице LLM-интеграции; вопросы защиты обучающих данных — в разделе защита при обучении модели.
Частые заблуждения
«Дообучение научит модель нашим фактам». Не лучший способ: факты живут в базе знаний и подгружаются при ответе; зашивать их в веса — дорого и неудобно обновлять. «Нужны гигабайты данных». Для RAG — нет: достаточно десятков актуальных страниц по процессу; качество и свежесть важнее объёма. «Обучили один раз — работает вечно». Документы устаревают, вопросы меняются: база знаний требует сопровождения от 50 000 ₽/мес, иначе ассистент через полгода уверенно отвечает по прошлогоднему регламенту. «Раз модель обучена, она не ошибается». Ошибается любой подход; разница в том, что при RAG ошибку видно по источнику и чинится заменой документа, а при fine-tuning — приходится переобучать.
Как выглядит первый месяц проекта
- Дни 1–5: инвентаризация документов процесса, чистка версий, обезличивание; параллельно — тестовая выборка вопросов.
- Неделя 2: сборка RAG-контура, нарезка документов, первые замеры качества на выборке — это уже прототип от 90 000 ₽.
- Недели 3–4: доработка фильтров и промптов, подключение двух-трёх пользователей, разбор неудачных ответов.
- Месяц 2: пилот на реальном потоке 4–6 недель с метриками — доля корректных ответов, доля эскалаций.
Такой порядок закрывает и техническую, и правовую часть: к моменту, когда ассистент выходит на живые данные, документы уже прошли чистку и обезличивание. Дальше в дело вступает сопровождение: обновление базы, контроль качества, новые версии документов.
Кому принадлежит результат
Юридический вопрос, который редко задают на старте. Нормальная схема для ИИ-проекта: база знаний — актив заказчика (это ваши документы в обработанном виде); код обвязки — по договору, чаще всего заказчику передаются права или лицензия; промпты, фильтры и наработки качества — предмет договора, и их лучше закрепить за собой сразу. Отдельно зафиксируйте режим данных: подрядчик не использует ваши документы для других проектов и не передаёт их третьим лицам. Если сегодня это звучит избыточно, вспомните, что через два года база знаний станет ядром десятка процессов — и переигрывать права на неё будет дороже, чем построить.
Итог
Дообучить модель на своих документах можно — и в большинстве случаев слово «дообучить» означает RAG: база знаний, которую модель читает при ответе. Это быстрее (прототип от 90 000 ₽ за 3–5 дней), безопаснее (документы можно изъять) и прослеживаемее (ответ со ссылкой на источник). Fine-tuning оставляют стилю и форматам. Единственное жёсткое «нельзя» — персональные данные без правового основания; всё остальное — вопрос правильной подготовки документов и выбора между RAG и fine-tuning. Начать стоит с одного процесса и десятков страниц актуальных документов: качество базы решает больше, чем размер модели, а проверить это дешевле всего прототипом за 3–5 дней.