Исследователи представили новый подход к работе с пропусками в данных для вероятностных регрессионных деревьев (PRTrees). Метод позволяет интегрировать обработку отсутствующих значений непосредственно в процесс построения дерева, исключая необходимость предварительной импутации. Предложенные стратегии используют вероятностные назначения разбиений, что обеспечивает консистентность прогнозов и повышает точность моделей при работе с неполными наборами данных в задачах регрессии.
Классические алгоритмы деревьев решений часто требуют заполнения пропусков средними значениями или использования суррогатных разбиений, что может искажать структуру данных. Новый фреймворк PRTree сохраняет гладкость предсказаний, обрабатывая пропущенные признаки как часть вероятностного распределения. Это позволяет модели сохранять неопределенность относительно отсутствующих данных, вместо того чтобы принудительно заменять их фиксированными значениями.
Авторы статьи предложили три стратегии адаптации, которые позволяют дереву эффективно распределять веса наблюдений при прохождении через узлы с отсутствующими признаками. Такой подход делает модель более устойчивой к «шумным» данным и снижает вычислительные затраты на этапе предобработки, так как пайплайн подготовки данных значительно упрощается.
Ключевые факты
- Метод ориентирован на вероятностные регрессионные деревья (PRTrees), обеспечивающие непрерывные прогнозы.
- Разработаны три стратегии обработки пропусков, встроенные непосредственно в алгоритм построения дерева.
- Исключается этап предварительной импутации (заполнения) данных, что предотвращает внесение систематических ошибок.
- Подход сохраняет консистентность и гладкость модели при работе с неполными входными данными.
- Исследование опубликовано в препринте arXiv под номером 2608.06195v1.