Исследователи представили фреймворк для контроля частоты ложных обнаружений (FDR) при отборе признаков в сложных моделях. Метод Group Gaussian Mirror и Permutation SHAP позволяет эффективно работать с группами взаимосвязанных параметров, такими как лаги, рекуррентные состояния или механизмы внимания, что ранее было затруднительно для стандартных алгоритмов, ориентированных на отдельные веса.
Традиционные подходы к отбору признаков часто игнорируют структурную зависимость данных, рассматривая каждый элемент как независимую гипотезу. В современных архитектурах, где один признак может быть представлен блоком подпризнаков, это приводит к снижению точности интерпретации модели. Предложенное решение адаптирует статистический контроль FDR к групповой структуре, сохраняя при этом гибкость по отношению к типу используемой модели.
Алгоритм сочетает в себе методы зеркалирования данных (Gaussian Mirror) и перестановочный анализ важности признаков (Permutation SHAP). Это позволяет исследователям более надежно определять значимые группы признаков, минимизируя риск принятия случайных корреляций за реальные закономерности. Метод является модель-агностическим, что делает его применимым как для классических статистических моделей, так и для глубоких нейронных сетей.
Ключевые факты
- Метод решает проблему контроля FDR для групповых признаков, которые типичны для моделей с вниманием и рекуррентными связями.
- Алгоритм использует комбинацию Gaussian Mirror и Permutation SHAP для оценки важности блоков признаков.
- Подход является модель-агностическим, что позволяет использовать его для широкого спектра архитектур машинного обучения.
- Разработка направлена на повышение интерпретируемости моделей в задачах, где признаки имеют сложную внутреннюю структуру или временные зависимости.