Исследователи представили новый подход к построению случайных лесов, заменяющий стандартные критерии разбиения на основе среднего значения на методы, анализирующие полные условные распределения откликов. Использование критериев максимального среднего расхождения (MMD) позволяет моделям лучше улавливать сложные зависимости в данных, повышая точность прогнозирования и устойчивость алгоритмов к шуму в различных сценариях машинного обучения.

Традиционные деревья решений (CART) при выборе узлов опираются на минимизацию дисперсии, что часто ограничивает способность модели описывать неоднородные распределения. Предложенная реализация в рамках «честных лесов» (honest forests) использует случайные признаки Фурье для аппроксимации MMD, что обеспечивает эффективное сравнение распределений в дочерних узлах. Авторы систематически изучили влияние различных вариантов сжатия и адаптивных настроек ширины полосы пропускания на итоговую производительность.

Метод демонстрирует значительные преимущества в задачах, где важна не только точечная оценка, но и понимание структуры распределения целевой переменной. Внедрение изотропных и анизотропных вариантов MMD позволяет гибко настраивать модель под конкретные типы данных, сохраняя при этом вычислительную эффективность, характерную для ансамблевых методов обучения.

Ключевые факты

  • Разработан метод замены стандартного разбиения по среднему значению на сравнение полных условных распределений.
  • Внедрены критерии на основе изотропного и анизотропного максимального среднего расхождения (MMD) с использованием случайных признаков Фурье.
  • Исследование проведено в рамках единой реализации «честного леса» (honest forest) для обеспечения сопоставимости результатов.
  • Предложены адаптивные механизмы настройки ширины полосы пропускания для каждого узла разбиения.
  • Метод направлен на повышение устойчивости и точности моделей в задачах, где распределение отклика имеет сложную структуру.