Полное дообучение большой модели — дорого и громоздко: обновляются миллиарды весов, для обучения нужен серьёзный GPU-парк, а каждая новая задача требует отдельной копии модели. LoRA решила эту проблему изящно: обучать не саму модель, а компактную надстройку над ней, оставляя базовые веса нетронутыми.
Как работает LoRA
Наблюдение, на котором держится метод: изменения весов при дообучении имеют низкоранговую структуру — их можно приблизить произведением двух маленьких матриц. LoRA добавляет к обучаемым слоям такие пары-адаптеры: на инференсе выход базового слоя складывается с выходом адаптера. Ранг — главный гиперпараметр: чем он выше, тем выразительнее адаптер и тем больше в нём параметров.
У адаптеров есть и инженерная цена: небольшая задержка на инференсе и необходимость держать набор подключённых адаптеров под контролем версий. Поэтому в production зрелые команды фиксируют связку «база + адаптер + данные обучения» как единый релиз — это же требование воспроизводимости закрепляет и регламентная практика.
Числа говорят сами за себя: адаптер часто составляет доли процента от объёма базовой модели. Обучение возможно на одной профессиональной видеокарте там, где полный файнтюнинг требовал кластера, а хранение десяти задач — это одна база и десять лёгких адаптеров, а не десять полных копий.
Адаптеры как плагины
- Переключение задач: юридический стиль для документооборота, телеграфный — для уведомлений; база одна.
- Версионирование: адаптер — это файл, который можно откатить, сравнить и передать.
- Комбинирование: адаптеры смешиваются, степенью дообучения управляют коэффициентом.
- Совместимость с квантизацией: QLoRA — обучение адаптера поверх сжатой 4-битной базы — сделала дообучение доступным даже на рабочих станциях.
Зачем бизнесу
- Стоимость входа. Персонализация модели перестала быть эксклюзивом корпораций с дата-центрами.
- Независимость от версии базы. Базовую модель можно обновить, сохранив адаптеры и дообучив их быстрее.
- Контур данных. Компактное обучение проще уместить в собственную инфраструктуру — данные не покидают периметр. Сравнение стоимостей — в ответе что дешевле: GigaChat или своя модель.
Связь с инфраструктурой инференса — GPU, память, латентность — разобрана в GPU-инференсе; экономия от сжатия моделей — в квантизации LLM.
Границы метода
LoRA — не замена знаниям: новые факты и документы по-прежнему правильнее давать через RAG, а не зашивать в адаптер. Слабее метод и там, где нужно радикально новое поведение, не выражающееся надстройкой над существующими весами. Развилка «поведение против знаний» разобрана в RAG или дообучение. Отдельная зона осторожности — чувствительные данные в адаптере: формально он не содержит исходных текстов, но теоретически может «запомнить» фрагменты, поэтому обучающие выборки проходят ту же юридическую проверку, что и датасеты полного дообучения.
Цены «от» (сентябрь 2026)
Аудит процессов и данных — от 90 000 ₽; пилот с адаптером под задачу — от 480 000 ₽ за 4–6 недель; полный контур с локальным инференсом — 0,9–1,2 млн ₽; ставки — 2 800–3 800 ₽/ч. Цены сентября 2026, без НДС (УСН).
С чего начать
Если у вас уже есть RAG-контур и остались претензии только к стилю и формату ответов — это сигнатура задачи под LoRA. Соберите логи «плохих» ответов: они станут датасетом, по которому видно, достаточно адаптера или нужен другой сценарий целиком. Заодно определите, кто владеет реестром адаптеров: без владельца «зоопарк» надстроек множится так же быстро, как теневые ИИ-сервисы, и однажды выясняется, что прод отвечает адаптер, о котором никто не помнит. Реестр из трёх колонок — база, адаптер, владелец — решает вопрос целиком и мгновенно.