Исследователи из Стэнфорда представили новую интерпретацию работы полносвязных слоев (MLP) в трансформерах, рассматривая их как системы ассоциативной памяти, работающие по принципу правила Хебба. Авторы доказывают, что веса MLP можно эффективно использовать для прямого кодирования фактов, что открывает путь к созданию моделей с более точным и управляемым хранением знаний без необходимости полного переобучения.

Традиционно MLP в архитектуре трансформеров воспринимаются как «черный ящик», отвечающий за обработку признаков. Однако новый подход позволяет интерпретировать эти слои как хранилища данных, где информация записывается через обновление весов, аналогичное биологическим синаптическим связям. Это упрощает процесс «редактирования» знаний внутри модели: вместо дообучения на огромных датасетах можно точечно модифицировать конкретные веса, чтобы обновить или дополнить базу фактов, которыми оперирует нейросеть.

Данное исследование предлагает практический рецепт для разработчиков, стремящихся повысить прозрачность моделей. Метод позволяет превратить стандартные слои в структурированные хранилища, что критически важно для снижения галлюцинаций и повышения достоверности ответов в агентных системах, требующих работы с актуальными данными. Такой подход меняет парадигму от «обучения как подгонки распределений» к «обучению как записи в память».

Ключевые факты

  • Исследование проведено группой Hazy Research из Стэнфордского университета.
  • Предложенная архитектура интерпретирует MLP-слои как хеббиановские системы памяти для хранения фактов.
  • Метод позволяет проводить точечное обновление знаний в модели без необходимости полного цикла дообучения.
  • Подход способствует повышению интерпретируемости весов и снижению вероятности генерации ложных данных (галлюцинаций).