Исследователи предложили новый подход к кластеризованному федеративному обучению (CFL), позволяющий эффективно группировать клиентов с похожими распределениями данных при сохранении конфиденциальности. Метод использует распределенный алгоритм максимизации ожидания (EM) над метаданными, что позволяет преодолеть «трилемму CFL», связанную с необходимостью балансировать между приватностью, затратами на коммуникацию и вычислительной эффективностью при обучении моделей на распределенных данных.
Традиционные методы федеративного обучения часто сталкиваются с проблемой неоднородности данных, когда модели, обученные на разных клиентах, плохо адаптируются к общим задачам. Новый подход решает эту проблему за счет формирования кластеров, где каждый клиент получает модель, максимально соответствующую его локальному распределению данных. Использование метаданных вместо передачи самих данных или их градиентов позволяет существенно снизить нагрузку на сеть, сохраняя при этом совместимость с методами шифрования.
Данная разработка направлена на оптимизацию обучения в сценариях, где данные распределены по множеству устройств, но не могут быть переданы на центральный сервер из соображений приватности или ограничений пропускной способности. Алгоритм позволяет проводить итеративное уточнение кластеров, что повышает точность итоговых моделей по сравнению со стандартными методами федеративного усреднения.
Ключевые факты
- Предложен метод, использующий распределенный алгоритм максимизации ожидания (EM) для работы с метаданными.
- Разработанный подход направлен на решение «трилеммы CFL», возникающей при попытке оптимизировать приватность, коммуникационные затраты и вычислительную эффективность.
- Метод обеспечивает совместимость с протоколами шифрования, что критично для защиты данных в федеративных сетях.
- Алгоритм позволяет эффективно группировать клиентов с идентичными распределениями данных без необходимости обмена сырыми данными или их градиентами.