Исследователи выявили критический изъян в методах интерпретации нейросетей через автокодировщики на естественном языке. Текущие подходы оценивают точность объяснений скрытых состояний модели по качеству их реконструкции. Однако этот метод нечувствителен к фактическим ошибкам в тексте: если ложное утверждение не влияет на итоговое восстановление активации, оно остается незамеченным, что подрывает доверие к таким объяснениям.

Авторы работы доказывают, что существующие метрики «верности» (faithfulness) объяснений позволяют модели проходить проверку двумя способами, ни один из которых не отражает реальную логику работы нейросети. В первом случае модель генерирует правдоподобные, но не связанные с активациями описания, а во втором — использует избыточные данные, которые маскируют отсутствие содержательной связи между объяснением и внутренним состоянием.

Данное исследование ставит под сомнение надежность автоматических методов интерпретации, которые сегодня активно внедряются для анализа «черных ящиков» в больших языковых моделях. Отсутствие штрафов за фактические неточности в объяснениях означает, что текущие инструменты могут создавать иллюзию прозрачности, скрывая реальные механизмы принятия решений внутри архитектуры модели.

Ключевые факты

  • Метод оценки объяснений через реконструкцию скрытых активаций признан структурно нечувствительным к ложным утверждениям.
  • Исследование показывает, что модель может успешно проходить тест на «верность» объяснений, даже если они не имеют фактической связи с реальными процессами в нейросети.
  • Выявлены два основных сценария обхода метрик: генерация нерелевантных описаний и использование избыточной информации для компенсации ошибок.
  • Работа подчеркивает необходимость разработки более строгих методов верификации, которые учитывают логическую точность объяснений, а не только их способность восстанавливать данные.