Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Вопросы и цены · сентябрь 2026

Можно ли дообучить модель на своих документах?

Краткий ответ · актуально на 19.09.2026
Краткий ответ: Да, двумя путями: RAG — модель читает вашу базу знаний без изменения весов (быстрее, безопаснее, обновляется моментально), и fine-tuning — дообучение весов под стиль и форматы (требует чистого датасета и больше времени). Обучать модель на персональных данных без правового основания нельзя. Прототип RAG — от 90 000 ₽.

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

Два пути «обучить на своих документах»

Когда заказчик говорит «дообучите модель на наших документах», он почти всегда хочет одного: чтобы ассистент отвечал фактами компании — регламентами, договорами, каталогом. Технически это делается двумя принципиально разными способами, и выбор между ними определяет цену, сроки и риски проекта. Первый — RAG (retrieval-augmented generation): документы раскладываются в векторную базу, модель при каждом вопросе находит нужные фрагменты и отвечает по ним. Веса модели не меняются. Второй — fine-tuning: модель фактически дообучается на подготовленном датасете примеров «вопрос — правильный ответ». Веса меняются, модель «запоминает» стиль и формат; результат — файл весов, который нельзя отредактировать руками, а можно только переобучить на новой версии датасета — отсюда и более длинный цикл изменений.

Пошаговая методика обучения на документах компании — в ответе как обучить LLM на документах компании; здесь — правая и ценовая сторона вопроса «можно ли».

Что выбрать: сравнение без маркетинга

КритерийRAGFine-tuning
Скорость запускапрототип 3–5 дней от 90 000 ₽недели на датасет и обучение
Обновление знанийзагрузил новый документ — сразу отвечаеттребует переобучения
Прослеживаемость ответассылка на фрагмент документаответ «из головы», источник не виден
Стиль и формат ответовзадаётся промптомсильная сторона — устойчивый стиль
Риск утечки содержанияконтур под контролем, документы можно изъятьсодержание «вшито» в веса, изъять нельзя

Развёрнутое сравнение — в материале RAG против fine-tuning — что выбрать. Практический вывод индустрии: 80–90% бизнес-задач закрываются RAG, fine-tuning подключают для специфических форматов и стиля, когда промптов уже мало.

Правовая рамка: что можно, что нельзя

Документы бывают разные. Регламенты, инструкции, каталоги, публичная документация — обучать и загружать можно свободно, это ваши знания. Персональные данные — нельзя без правового основания: для обработки нужно согласие субъекта или иное законное основание по 152-ФЗ, а для передачи в обучение внешнему сервису — отдельная история с локализацией и поручением обработки. Коммерческую тайну в облачный контур не отдают вообще без NDA и договорного запрета обучения на ваших данных. Подробно правовой разбор — в ответе почему нельзя обучать LLM на персональных данных.

Как готовить документы

  • Инвентаризация: собрать документы, разложить по процессам, выкинуть устаревшие версии — модель, обученная на двух редакциях регламента, отвечает случайно то одной, то другой.
  • Чистка: удалить ПДн там, где они не нужны для ответа, или обезличить; пометить конфиденциальные блоки.
  • Структура: для RAG документы нарезаются на фрагменты — качество нарезки сильно влияет на качество ответов.
  • Тестовая выборка: 50–100 реальных вопросов с эталонными ответами — без неё вы не докажете, что «дообучение» сработало.

Сколько это стоит

Вход в RAG — аудит процессов и данных от 90 000 ₽ и прототип от 90 000 ₽ за 3–5 дней: вы проверяете на своих документах, что ассистент отвечает по делу. Дальше MVP — от 690 000 ₽ за 2–3 недели, пилот на процессе — от 480 000 ₽ за 4–6 недель. Услуга целиком — на странице LLM-интеграции; вопросы защиты обучающих данных — в разделе защита при обучении модели.

Частые заблуждения

«Дообучение научит модель нашим фактам». Не лучший способ: факты живут в базе знаний и подгружаются при ответе; зашивать их в веса — дорого и неудобно обновлять. «Нужны гигабайты данных». Для RAG — нет: достаточно десятков актуальных страниц по процессу; качество и свежесть важнее объёма. «Обучили один раз — работает вечно». Документы устаревают, вопросы меняются: база знаний требует сопровождения от 50 000 ₽/мес, иначе ассистент через полгода уверенно отвечает по прошлогоднему регламенту. «Раз модель обучена, она не ошибается». Ошибается любой подход; разница в том, что при RAG ошибку видно по источнику и чинится заменой документа, а при fine-tuning — приходится переобучать.

Как выглядит первый месяц проекта

  • Дни 1–5: инвентаризация документов процесса, чистка версий, обезличивание; параллельно — тестовая выборка вопросов.
  • Неделя 2: сборка RAG-контура, нарезка документов, первые замеры качества на выборке — это уже прототип от 90 000 ₽.
  • Недели 3–4: доработка фильтров и промптов, подключение двух-трёх пользователей, разбор неудачных ответов.
  • Месяц 2: пилот на реальном потоке 4–6 недель с метриками — доля корректных ответов, доля эскалаций.

Такой порядок закрывает и техническую, и правовую часть: к моменту, когда ассистент выходит на живые данные, документы уже прошли чистку и обезличивание. Дальше в дело вступает сопровождение: обновление базы, контроль качества, новые версии документов.

Кому принадлежит результат

Юридический вопрос, который редко задают на старте. Нормальная схема для ИИ-проекта: база знаний — актив заказчика (это ваши документы в обработанном виде); код обвязки — по договору, чаще всего заказчику передаются права или лицензия; промпты, фильтры и наработки качества — предмет договора, и их лучше закрепить за собой сразу. Отдельно зафиксируйте режим данных: подрядчик не использует ваши документы для других проектов и не передаёт их третьим лицам. Если сегодня это звучит избыточно, вспомните, что через два года база знаний станет ядром десятка процессов — и переигрывать права на неё будет дороже, чем построить.

Итог

Дообучить модель на своих документах можно — и в большинстве случаев слово «дообучить» означает RAG: база знаний, которую модель читает при ответе. Это быстрее (прототип от 90 000 ₽ за 3–5 дней), безопаснее (документы можно изъять) и прослеживаемее (ответ со ссылкой на источник). Fine-tuning оставляют стилю и форматам. Единственное жёсткое «нельзя» — персональные данные без правового основания; всё остальное — вопрос правильной подготовки документов и выбора между RAG и fine-tuning. Начать стоит с одного процесса и десятков страниц актуальных документов: качество базы решает больше, чем размер модели, а проверить это дешевле всего прототипом за 3–5 дней.

Частые вопросы

Нет: достаточно владельца процесса, который скажет, какие документы актуальны. Техническую работу — нарезку, загрузку, тесты — делает подрядчик.

При RAG — да, ответы перестанут опираться на удалённые документы, это и есть контроль; при fine-tuning содержание остаётся в весах — ещё одна причина выбирать RAG для чувствительных данных.

Для прототипа хватает десятков страниц по одному процессу; качество важнее объёма — 50 актуальных страниц работают лучше тысячи устаревших.

Бесплатный разбор ТЗ

Опишите процесс, который хотите автоматизировать (2–3 предложения), — за 1 рабочий день вернём лестницу цен под вашу задачу.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.