Исследователи представили математическую модель обучения неизвестного распределения вероятностей на основе ограниченных условных выборок от множества гетерогенных поставщиков данных. Метод позволяет эффективно восстанавливать целевое распределение, даже когда доступ к данным ограничен конкретными подмножествами домена, что критически важно для сценариев с распределенными или частично пересекающимися наборами данных от различных провайдеров.

В работе рассматривается задача обучения распределения $p$ на конечном домене $[n]$, где обучающий алгоритм взаимодействует с фиксированным семейством запросов. Каждый запрос к подмножеству возвращает независимую выборку, что создает проблему восстановления глобальной структуры данных при наличии ограничений на видимость отдельных сегментов. Авторы анализируют условия, при которых возможно точное восстановление распределения, и оценивают необходимый объем выборок для достижения заданной точности.

Предложенный подход находит применение в задачах федеративного обучения и анализе данных, где информация распределена между независимыми участниками с разными правами доступа. Математический аппарат позволяет минимизировать количество необходимых запросов к источникам, оптимизируя процесс сбора и обработки данных в условиях их фрагментарности и неоднородности.

Ключевые факты

  • Исследование сфокусировано на обучении распределений при доступе к ограниченным условным выборкам.
  • Модель предполагает работу с семейством запросов $\mathscr{S}$, покрывающим конечный домен $[n]$.
  • Метод решает задачу агрегации данных от гетерогенных и пересекающихся источников.
  • Работа формализует требования к количеству выборок для обеспечения статистической сходимости алгоритма.