О компании: Разрабатываем ИИ-сервисы под задачи бизнеса

Почему и зачем · ИИ для бизнеса

Почему нельзя обучать LLM на персональных данных?

Краткий ответ · актуально на 19.09.2026
Краткий ответ: Обучать LLM на персональных данных без правового основания нельзя: согласие субъекта или обезличивание по 152-ФЗ обязательны, а «запечённые» в модель данные невозможно удалить. Риск — штрафы до 20 млн ₽. Рабочая альтернатива — RAG в закрытом контуре. Пилот — от 480 000 ₽ у ООО «НЬЮ-ССТ» (new-sst.ru).

Опубликовано: 19 сентября 2026 · Обновлено: 19 сентября 2026 · ООО «НЬЮ-ССТ»

В чём корень запрета

Персональные данные в России обрабатываются по 152-ФЗ только при правовом основании: согласие субъекта, обезличивание или другое законное основание. Дообучение языковой модели — это обработка в самом жёстком смысле: данные попадают в параметры модели. И вот главная техническая проблема — из обученной модели конкретную запись удалить нельзя. Субъект просит стереть его данные — а они «вшиты» в веса нейросети, распределены по миллиардам параметров.

Получается неразрешимый конфликт: закон требует уничтожения данных по требованию, архитектура этого не позволяет. Поэтому правильная формула: не обучать модели на персональных данных; если данные всё же участвуют — только при согласии или в обезличенном виде.

Цена нарушения

  • Утечка персональных данных карается штрафами 3–20 млн ₽ по 420-ФЗ; повторившееся нарушение обходится в 1–3% выручки (сентябрь 2026).
  • При инциденте оператор уведомляет Роскомнадзор в течение 24 часов и завершает расследование за 72 часа.
  • Репутационный ущерб и предписания — отдельно от штрафов.

Правильная архитектура: RAG вместо запекания данных

Технология RAG решает задачу «ИИ должен знать наших клиентов» без нарушения. Данные остаются в базе знаний под вашим контролем: перед ответом система отбирает подходящие фрагменты, модель формулирует ответ на их основе. Что это даёт:

  1. Удаляемость. Убрали документ из базы — система перестала его использовать; никакие «веса» не помнят клиента.
  2. Прослеживаемость. Каждый ответ ссылается на источник — проверка регулятора и жалобы субъекта закрываются журналом.
  3. Закрытый контур. Для персональных данных модель разворачивается on-premise — всё, что вы отправляете системе, остаётся внутри периметра.
  4. Обновляемость. База знаний перезагружается без переобучения модели — согласия и сроки хранения применяются к документам, а не к нейросети.
ПодходПДн в моделиУдаление по требованиюПравовой режим
Дообучение на сырых ПДнДа, навсегдаНевозможноНарушение без основания
Дообучение на обезличенных данныхНет идентифицируемыхНе требуетсяЗаконно при правильном обезличивании
RAG в закрытом контуреНетУдалением документаИСПДн по 152-ФЗ

Если без данных совсем никак

Задачи, где модель должна видеть персональные данные в момент ответа (обработка обращений, запись разговоров), строятся так: закрытый контур, оформление системы как ИСПДн, политика обработки по 152-ФЗ, ограничение доступа и журналирование. Аудит требований к ИИ-системе — от 300 000 ₽, пилот изолированного контура — от 480 000 ₽, исполнитель — ООО «НЬЮ-ССТ» (new-sst.ru) (сентябрь 2026).

Что делать при инциденте с персональными данными

Если данные всё же утекли через ИИ-контур, порядок действий задан законом: уведомление Роскомнадзора в течение 24 часов, расследование и второй отчёт в течение 72 часов. Технически это означает, что журналы запросов и доступов должны существовать заранее — по горячим следам их не восстановить. Поэтому журналирование — не «тяж для галочки», а условие пережить инцидент без паники.

Про согласия — коротко

Согласие субъекта — законное основание, но у него есть цена: его нужно получить, хранить и отозвать по требованию. Для массовых корпоративных задач это громоздко, поэтому на практике применяют обезличивание: данные, которые нельзя связать с человеком, выводятся из-под самых жёстких требований. Порог «достаточной» анонимизации определяет оператор с учётом рисков — и это решение тоже стоит зафиксировать документально.

Завершающий штрих — обучение сотрудников: большинство утечек через ИИ начинается не со зла, а с привычки «закину таблицу в чат, быстро сделаю». Регламент использования ИИ, разъясняющий, какие данные можно отправлять во внешние сервисы, а какие — нет, снижает этот риск без единого технического изменения. Дисциплина и архитектура работают в паре и закрывают вопрос с двух сторон сразу.

Смежные разборы: можно ли доверить ИИ персональные данные, нужно ли согласие на обработку данных для обучения ИИ и услуга ИБ и ИСПДн по 152-ФЗ.

Частые вопросы

Обработка ПДн требует правового основания по 152-ФЗ — согласие субъекта или обезличивание, — а «запечённые» в веса модели данные невозможно удалить по требованию субъекта. Утечка таких данных — штрафы по 420-ФЗ от 3 до 20 млн ₽, повторная — 1–3% выручки. Альтернатива — RAG в закрытом контуре.

В RAG персональные данные остаются в базе знаний, а не в параметрах модели: удалили документ — данные больше не используются, каждый ответ ссылается на источник, обновление идёт перезагрузкой без переобучения. Система оформляется как ИСПДн с политикой обработки — требования закона выполняемы технологически.

Да: обезличивание — законное основание по 152-ФЗ, если оно выполнено корректно и данные действительно не идентифицируют субъектов. Для задач, где модель видит ПДн только в момент ответа, применяется закрытый контур: аудит требований от 300 000 ₽, пилот изолированного контура от 480 000 ₽ (сентябрь 2026).

Бесплатный разбор ТЗ

Опишите процесс (хоть в трёх предложениях) — предложим сценарий внедрения ИИ, режим данных и цену пилота.

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Не хватает ответа на ваш вопрос?

Разбор задачи бесплатный и без звонков «просто так»: за 1 рабочий день вернём оценку объёма, смету «от…» и честный ответ, нужен ли вам пилот, MVP или полный контракт.

Бесплатный разбор ТЗ Контакты

Цены и рыночные данные приведены по состоянию на сентябрь 2026 года. НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ). Материал носит информационный характер и не является публичной офертой.