О компании: Разрабатываем ИИ-сервисы под задачи бизнеса

Словарь ИИ · определения

Что такое LoRA?

LoRA (Low-Rank Adaptation) — техника эффективного дообучения: обучаются не все веса модели, а маленькие матрицы-надстройки низкого ранга. Памяти нужно в разы меньше, исходная модель не меняется, адаптеры можно переключать.

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

Полное дообучение большой модели — дорого и громоздко: обновляются миллиарды весов, для обучения нужен серьёзный GPU-парк, а каждая новая задача требует отдельной копии модели. LoRA решила эту проблему изящно: обучать не саму модель, а компактную надстройку над ней, оставляя базовые веса нетронутыми.

Как работает LoRA

Наблюдение, на котором держится метод: изменения весов при дообучении имеют низкоранговую структуру — их можно приблизить произведением двух маленьких матриц. LoRA добавляет к обучаемым слоям такие пары-адаптеры: на инференсе выход базового слоя складывается с выходом адаптера. Ранг — главный гиперпараметр: чем он выше, тем выразительнее адаптер и тем больше в нём параметров.

У адаптеров есть и инженерная цена: небольшая задержка на инференсе и необходимость держать набор подключённых адаптеров под контролем версий. Поэтому в production зрелые команды фиксируют связку «база + адаптер + данные обучения» как единый релиз — это же требование воспроизводимости закрепляет и регламентная практика.

Числа говорят сами за себя: адаптер часто составляет доли процента от объёма базовой модели. Обучение возможно на одной профессиональной видеокарте там, где полный файнтюнинг требовал кластера, а хранение десяти задач — это одна база и десять лёгких адаптеров, а не десять полных копий.

Адаптеры как плагины

  • Переключение задач: юридический стиль для документооборота, телеграфный — для уведомлений; база одна.
  • Версионирование: адаптер — это файл, который можно откатить, сравнить и передать.
  • Комбинирование: адаптеры смешиваются, степенью дообучения управляют коэффициентом.
  • Совместимость с квантизацией: QLoRA — обучение адаптера поверх сжатой 4-битной базы — сделала дообучение доступным даже на рабочих станциях.

Зачем бизнесу

  • Стоимость входа. Персонализация модели перестала быть эксклюзивом корпораций с дата-центрами.
  • Независимость от версии базы. Базовую модель можно обновить, сохранив адаптеры и дообучив их быстрее.
  • Контур данных. Компактное обучение проще уместить в собственную инфраструктуру — данные не покидают периметр. Сравнение стоимостей — в ответе что дешевле: GigaChat или своя модель.

Связь с инфраструктурой инференса — GPU, память, латентность — разобрана в GPU-инференсе; экономия от сжатия моделей — в квантизации LLM.

Границы метода

LoRA — не замена знаниям: новые факты и документы по-прежнему правильнее давать через RAG, а не зашивать в адаптер. Слабее метод и там, где нужно радикально новое поведение, не выражающееся надстройкой над существующими весами. Развилка «поведение против знаний» разобрана в RAG или дообучение. Отдельная зона осторожности — чувствительные данные в адаптере: формально он не содержит исходных текстов, но теоретически может «запомнить» фрагменты, поэтому обучающие выборки проходят ту же юридическую проверку, что и датасеты полного дообучения.

Цены «от» (сентябрь 2026)

Аудит процессов и данных — от 90 000 ₽; пилот с адаптером под задачу — от 480 000 ₽ за 4–6 недель; полный контур с локальным инференсом — 0,9–1,2 млн ₽; ставки — 2 800–3 800 ₽/ч. Цены сентября 2026, без НДС (УСН).

С чего начать

Если у вас уже есть RAG-контур и остались претензии только к стилю и формату ответов — это сигнатура задачи под LoRA. Соберите логи «плохих» ответов: они станут датасетом, по которому видно, достаточно адаптера или нужен другой сценарий целиком. Заодно определите, кто владеет реестром адаптеров: без владельца «зоопарк» надстроек множится так же быстро, как теневые ИИ-сервисы, и однажды выясняется, что прод отвечает адаптер, о котором никто не помнит. Реестр из трёх колонок — база, адаптер, владелец — решает вопрос целиком и мгновенно.

Частые вопросы

LoRA обычно на порядок дешевле: обучается меньше процента параметров, требования к видеопамяти ниже, а базовая модель не копируется под каждую задачу.

Базовые веса не меняются, поэтому общие способности сохраняются. Плохо настроенный адаптер может портить ответы конкретной задачи — его откатывают и переобучают.

Да, это стандартная связка QLoRA: адаптер обучается поверх сжатой 4-битной модели, что ещё сильнее снижает порог входа.

Бесплатный разбор ТЗ

Пришлите ТЗ, описание процесса или ссылку на закупку — оценим объём, дадим смету «от…» и честно скажем, какой формат вам нужен: пилот или полный контракт.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.