Исследователи проанализировали ограничения использования разреженных автокодировщиков (SAE) для интерпретации нейросетей. Выяснилось, что текущие методы часто не учитывают разрыв между активацией признаков и их реальным влиянием на поведение модели. Авторы работы предложили новый подход к анализу геометрии признаков, который позволяет точнее предсказывать причинно-следственные эффекты и улучшить управление генерацией текста через манипуляцию внутренними представлениями.
Проблема интерпретируемости заключается в том, что многие признаки, выделяемые автокодировщиками, имеют понятные семантические описания, но при этом демонстрируют слабые или непредсказуемые причинные эффекты. В ряде случаев попытки направленного воздействия на модель приводят к результатам, противоположным ожидаемым, либо зависят от контекста конкретного промпта. Это затрудняет использование SAE как надежного инструмента для отладки и контроля поведения больших языковых моделей.
Авторы работы вводят понятие «геометрии эффектов признаков», рассматривая их не просто как статистические паттерны активации, а как функциональные единицы, определяющие выходные данные. Такой подход помогает выявить скрытые признаки, которые ранее игнорировались при стандартном анализе, но играют ключевую роль в формировании ответов модели. Это исследование закладывает фундамент для более точных методов механистической интерпретируемости, позволяя разработчикам лучше понимать, как именно внутренние структуры модели преобразуют входные данные в конкретные логические выводы.
Ключевые факты
- Исследование выявило несоответствие между семантическим описанием признаков в SAE и их реальным влиянием на поведение LLM.
- Установлено, что стандартный отбор признаков на основе активаций часто пропускает функционально значимые компоненты, влияющие на результат.
- Предложен новый метод анализа геометрии признаков, который связывает внутренние представления модели с их причинно-следственным воздействием.
- Работа направлена на устранение нестабильности при «стиринге» (steering) — процессе направленного изменения поведения модели через активацию определенных признаков.