Исследователи представили метод Sparse Weight Decomposition (SWD) для извлечения интерпретируемых схем из предобученных трансформеров. В отличие от существующих подходов, требующих обучения вспомогательных разреженных моделей, SWD позволяет анализировать веса исходной нейросети напрямую. Это устраняет вычислительные затраты и разрыв в точности между анализируемым представлением и оригинальной архитектурой, повышая прозрачность работы сложных моделей.
Проблема интерпретируемости современных трансформеров заключается в том, что их плотные веса не содержат явно выраженных функциональных единиц. Традиционные методы часто полагаются на обучение дополнительных разреженных автокодировщиков или специфических слоев, что искажает внутреннюю логику модели. Новый подход декомпозирует веса на разреженные компоненты, сохраняя при этом исходные параметры модели без необходимости их дообучения или изменения архитектуры.
Метод позволяет исследователям точнее локализовать конкретные «схемы» (circuits) внутри нейросети, отвечающие за выполнение определенных задач. Это открывает возможности для более глубокого анализа механизмов принятия решений в LLM, упрощая отладку моделей и поиск потенциальных уязвимостей в их логике. Технология ориентирована на фундаментальное понимание того, как именно информация распределяется в весовых матрицах трансформеров.
Ключевые факты
- Метод Sparse Weight Decomposition (SWD) позволяет извлекать интерпретируемые схемы без обучения вспомогательных моделей.
- Подход исключает разрыв в точности (fidelity gap) между анализируемым представлением и оригинальной моделью.
- Техника направлена на решение проблемы «черного ящика» в плотных трансформерах через прямое разложение весовых матриц.
- Метод снижает вычислительные затраты на проведение анализа интерпретируемости по сравнению с подходами, требующими обучения дополнительных слоев.