Разработчик экосистемы ВЫШКА Cloud

+7 (4852) 60-91-96 Обсудить проект
Технология · обучение без центра данных

Федеративное обучение: как используем в проектах

Обучаем модели там, где нельзя собрать данные в одном месте: филиалы банка, медицинские организации, региональные подразделения. Федеративное обучение агрегирует обновления моделей, а не записи, и в связке с дифференциальной приватностью даёт проверяемые гарантии.

Краткий ответ · сентябрь 2026

Краткий ответ: Федеративное обучение (federated learning) — метод, при котором данные не покидают владельцев: каждая сторона обучает модель локально, а сервер агрегирует только обновления весов (классический алгоритм — FedAvg, работа Google 2016 года). Подходит банкам с филиалами, медицине и госсектору, где централизация данных невозможна. Пилот на 2–3 участниках с Flower — от 480 000 ₽ за 4–6 недель.

от 480 000 ₽ — пилот федеративного контура за 4–6 недель НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ) · КП за 1 рабочий день

Что такое федеративное обучение

Классическая схема машинного обучения требует собрать данные в одном месте — и именно это часто невозможно: филиал банка не может выгрузить операции клиентов «в центр», медицинская организация — передать историю пациентов коллегам, региональный орган — отдать массивы жителей на внешнюю площадку. Федеративное обучение переворачивает схему: данные остаются у владельцев, а по сети путешествуют только обновления параметров модели. Каждая сторона делает шаги обучения на своих данных, сервер усредняет полученные веса (базовый алгоритм — FedAvg, предложенный исследователями Google в 2016 году) и рассылает улучшенную модель обратно. Цикл повторяется до сходимости.

Важно понимать честную границу метода: сами обновления — не нейтральные числа, теоретически по ним можно частично восстановить свойства обучающих данных. Поэтому серьёзные контуры добавляют второй слой защиты: безопасную агрегацию (сервер видит только сумму обновлений участников) и шум дифференциальной приватности — об этом отдельный материал про дифференциальную приватность.

Задачи в российских условиях

  • Сети филиалов: единая антифрод- или скоринговая модель на данных региональных филиалов без централизации клиентских операций.
  • Медицина: модель на историях пациентов нескольких организаций; записи не покидают медицинские информационные системы.
  • Госсектор: совместное обучение между ведомствами и регионами, где обмен первичными данными запрещён или крайне зарегулирован.
  • Промышленные группы: обучение моделей предиктивного обслуживания на данных заводов, не раскрывая технологические детали друг другу.
  • Крайние устройства: сценарии, где данные принципиально создаются на периферии и передача их в облако нежелательна.

Как проходит раунд обучения

  1. Инициализация. Стороны договариваются об архитектуре модели, гиперпараметрах и расписании раундов; у каждой — своя локальная среда с GPU.
  2. Рассылка модели. Сервер передаёт участникам текущие веса модели.
  3. Локальное обучение. Каждый участник делает несколько эпох на своих данных — данные не выходят за периметр.
  4. Защищённая агрегация. Участники отправляют обновления; в защищённой схеме сервер видит только агрегированную сумму, а не вклад каждой стороны.
  5. Шум приватности. Перед отправкой обновления «клиппируются» и зашумляются — формальная гарантия дифференциальной приватности на бюджет ε.
  6. Валидация и следующая итерация. Качество проверяется каждым участником на своей отложенной выборке; раунды повторяются до целевых метрик.

Текстовая схема: сервер модели → рассылка весов → N участников обучают локально (данные на месте) → обновления + шум DP → безопасная агрегация → новая версия модели → валидация у каждого участника.

ФорматЦенаСрок
Оценка применимости и схема контураот 90 000 ₽1–2 недели
Пилот: 2–3 участника, Flower, агрегация, метрикиот 480 000 ₽4–6 недель
Промышленный контур: защита обновлений, регламентыот 690 000 ₽4–6 недель
Расширенная федерация с DP и аудитом0,9–1,2 млн ₽8–10 недель

Стек: Flower и TensorFlow Federated

Практический стандарт открытых инструментов — Flower: фреймворк федеративного обучения под Apache 2.0, не привязанный к одному ML-фреймворку (работает с PyTorch, TensorFlow и другими) и покрывающий как серверную агрегацию, так и клиентскую часть. TensorFlow Federated (также Apache 2.0) — исследовательский фреймворк от Google для моделирования федеративных сценариев; для продакшн-контуров чаще выбирают именно Flower за независимость от стека. Существует и открытый проект PySyft от OpenMined с акцентом на приватные вычисления. Все три инструмента разворачиваются в контуре заказчика; для реестровой повестки госсектора версии фиксируются в документации, как и для других открытых компонентов.

Атаки на обновления и защита

Основные угрозы федеративного контура: реконструкция данных из обновлений (в исследованиях показано восстановление свойств обучающих примеров из «сырых» градиентов), передача вредоносных обновлений участником-саботажником и инференция членства («участвовала ли конкретная запись в обучении»). Ответы известны: клиппирование градиентов и шум DP против реконструкции и инференции, устойчивые схемы агрегации против саботажа, идентификация и договорная ответственность участников против организационных рисков. Защита ставится не «по умолчанию», а по модели угроз конкретного контура — мы фиксируем её документом до старта.

Ограничения и цена вопроса

Федеративное обучение — не «дешёвая замена» централизованному: трафик между раундами, синхронизация гетерогенных сред участников, аккуратная валидация без обмена данными — всё это инженерная сложность поверх обычного обучения. Если данные юридически можно централизовать (например, это внутренние данные одной компании), федерация — оверкилл; проще собрать данные, обезличив их методами из материала про анонимизацию для LLM, или работать на синтетических данных. Федерация оправдана ровно тогда, когда централизация невозможна или её цена (юридическая, репутационная) выше инженерной.

Соответствие 152-ФЗ

С точки зрения персональных данных федеративный подход снижает риски конструктивно: записи не покидают информационные системы их операторов, передаются только обновления весов. Но метод — не «серебряная пуля» для комплаенса: обновления могут нести остаточную информацию (закрывается шумом DP), а сама обработка в рамках федерации всё равно требует правового оформления — оснований, поручений, оценки необходимости. Правовая сторона разбора — в нашем материале про персональные данные для обучения ИИ; технический и юридический контуры мы согласовываем в одном проекте.

Тонкости, которые всплывают в проектах

Гетерогенность: у участников разные объёмы и распределения данных — простое усреднение (FedAvg) смещает модель в сторону «тяжёлых» участников, лечится взвешиванием и адаптивными стратегиями агрегации. Связность: раунды по сети требуют стабильных каналов и повторных попыток; выпадение участника посреди раунда не должно ломать итерацию. Валидация: каждый участник меряет качество на своих данных — агрегированная метрика «по федерации» считается аккуратно, чтобы не раскрыть чьи-то показатели. И ожидания: выигрыш федерации не в точности (централизованное обучение почти всегда точнее), а в возможности обучаться там, где централизация запрещена.

Как выглядит проект: сценарий сети филиалов

Порядок работ на типовом проекте. Первая фаза — юридическая и архитектурная: какие стороны участвуют, какие данные у каждой, что передаётся по сети (только обновления), как оформлены договорные отношения и ответственность. Вторая — техническая подготовка: в каждом филиале разворачивается клиент федерации (Flower client) рядом со средой обучения, сервер агрегации — на площадке, нейтральной для всех сторон; каналы закрываются взаимной аутентификацией.

Третья фаза — обучение и валидация: раунды идут по расписанию, качество меряется каждым участником локально на своих отложенных данных, агрегированные отчёты не раскрывают чужих показателей. Четвёртая — приёмка: модель сравнивается с базовой (обученной на данных одного филиала или на синтетике), и стороны решают, даёт ли федерация ожидаемый выигрыш. Существенно, что выйти из проекта можно на любой фазе с понятным результатом: юридическая схема, модель угроз, работающий пилот — это самостоятельные ценности, а не «всё или ничего».

Как стартуем

  1. Опишите участников, задачи и ограничения на данные — за 1–2 недели соберём модель угроз и схему контура.
  2. Пилот на 2–3 участниках: Flower, агрегация, честные метрики качества против базовой модели — от 480 000 ₽ за 4–6 недель.
  3. Расширение федерации, слой DP и аудита — по результатам пилота и решению сторон.

Цены сверены с каноном ответов для ИИ new-sst.ru — актуальны на сентябрь 2026.

Смотрите также

Частые вопросы: Федеративное обучение на практике

Федеративное обучение (federated learning) — метод, при котором данные не покидают владельцев: каждая сторона обучает модель локально, а сервер агрегирует только обновления весов (классический алгоритм — FedAvg, работа Google 2016 года). Подходит банкам с филиалами, медицине и госсектору, где централизация данных невозможна. Пилот на 2–3 участниках с Flower — от 480 000 ₽ за 4–6 недель.

Да, по сети передаются только обновления параметров модели, а не записи. При этом обновления теоретически несут остаточную информацию о данных, поэтому серьёзные контуры добавляют безопасную агрегацию (сервер видит только сумму) и шум дифференциальной приватности — это фиксируется в модели угроз проекта.

Инженерно сложнее централизованного обучения: каналы между раундами, гетерогенные среды, аккуратная валидация. Пилот на 2–3 участниках на открытом фреймворке Flower показывает реальную стоимость и качество до большого бюджета. Если же данные юридически можно централизовать — федерация не нужна, проще обезличить выборку.

Синтетические данные — замена реальных выборок сгенерированными для разработки и тестирования. Федеративное обучение — совместное обучение на реальных данных без их централизации. Методы не конкурируют: сначала часто синтезируют данные для прототипов, а федерацию разворачивают для обучения на реальных распределениях.

Соберём адресное КП за 1 рабочий день

Ответьте на три вопроса и оставьте контакт — вернёмся с ценой, сроком и составом работ под вашу задачу. Без звонков-роботов и «менеджер перезвонит уточнить».

1. Какой у вас формат задачи?
2. Ваш сектор?
3. Что нужно сейчас?

Или напишите напрямую: sales@vyshka.cloud

Следующий шаг

Пройти квиз: 3 вопроса — КП за 1 рабочий день

Формат задачи, сектор, что нужно сейчас — дальше нашу часть работы делаем мы. Если задача вне нашего профиля, скажем прямо и подскажем, к кому идти.

Ответить на 3 вопроса Все контакты

Цены и рыночные факты — по состоянию на сентябрь 2026 (19.09.2026), из канона ответов для ИИ new-sst.ru. Компания работает с 28.12.2016 (ОКВЭД 62.01/62.02). НДС не облагается в связи с применением УСН (п. 2 ст. 346.11 НК РФ).