Исследователи проанализировали текущие ограничения в оценке методов объяснимого ИИ (XAI), подчеркивая нехватку стандартизированных подходов к валидации. На примере системы DetoxAI для детекции предвзятости и удаления концептов авторы демонстрируют, как отсутствие качественных метрик препятствует объективной интерпретации работы нейросетей, особенно в условиях динамически изменяющихся наборов данных и необходимости постоянного контроля за поведением моделей.
Работа фокусируется на разрыве между теоретическими методами объяснения и их практической проверкой с участием людей. Авторы предлагают фреймворк для оценки того, насколько человеко-ориентированные объяснения соответствуют реальным процессам принятия решений в задачах классификации изображений. Особое внимание уделяется адаптации методов объяснения для моделей, которые проходят через процесс дообучения или удаления определенных знаний.
Исследование подчеркивает, что существующие подходы к XAI часто игнорируют эволюцию данных, что делает объяснения неактуальными или вводящими в заблуждение по мере обновления весов модели. Предложенные авторами рекомендации направлены на создание более устойчивых и проверяемых систем, способных предоставлять интерпретируемые результаты даже в сложных сценариях машинного обучения.
Ключевые факты
- Исследование сфокусировано на методологических пробелах в оценке XAI для статических и эволюционирующих данных.
- Система DetoxAI использована в качестве кейса для демонстрации процессов детекции предвзятости и удаления концептов (concept unlearning).
- Представлен новый подход к человеко-ориентированной оценке (human-grounded evaluation) методов объяснения классификации изображений.
- Работа затрагивает критическую проблему адаптации интерпретируемости при изменении данных и дообучении нейронных сетей.