Исследователи выявили критический изъян в методах интерпретации нейросетей через автокодировщики на естественном языке. Текущие подходы оценивают точность объяснений скрытых состояний модели по качеству их реконструкции. Однако этот метод нечувствителен к фактическим ошибкам в тексте: если ложное утверждение не влияет на итоговое восстановление активации, оно остается незамеченным, что подрывает доверие к таким объяснениям.
Авторы работы доказывают, что существующие метрики «верности» (faithfulness) объяснений позволяют модели проходить проверку двумя способами, ни один из которых не отражает реальную логику работы нейросети. В первом случае модель генерирует правдоподобные, но не связанные с активациями описания, а во втором — использует избыточные данные, которые маскируют отсутствие содержательной связи между объяснением и внутренним состоянием.
Данное исследование ставит под сомнение надежность автоматических методов интерпретации, которые сегодня активно внедряются для анализа «черных ящиков» в больших языковых моделях. Отсутствие штрафов за фактические неточности в объяснениях означает, что текущие инструменты могут создавать иллюзию прозрачности, скрывая реальные механизмы принятия решений внутри архитектуры модели.
Ключевые факты
- Метод оценки объяснений через реконструкцию скрытых активаций признан структурно нечувствительным к ложным утверждениям.
- Исследование показывает, что модель может успешно проходить тест на «верность» объяснений, даже если они не имеют фактической связи с реальными процессами в нейросети.
- Выявлены два основных сценария обхода метрик: генерация нерелевантных описаний и использование избыточной информации для компенсации ошибок.
- Работа подчеркивает необходимость разработки более строгих методов верификации, которые учитывают логическую точность объяснений, а не только их способность восстанавливать данные.