Юрген Шмидхубер представил архивную работу 1991 года, в которой описывается архитектура, предвосхищающая современные линейные трансформеры. Автор демонстрирует, как использование ненормализованных весов и специфических механизмов внимания позволяет эффективно моделировать последовательности. Исследование подчеркивает фундаментальную связь между ранними рекуррентными нейронными сетями и современными методами обработки данных с линейной сложностью вычислений.

В публикации детально разбирается подход, основанный на «быстрых весах» (fast weights), которые позволяют сети динамически адаптироваться к контексту без необходимости изменения основных параметров модели. Этот метод позволяет нейронной сети хранить информацию о недавних событиях во временных весах, что концептуально близко к тому, как работают современные механизмы внимания в архитектурах трансформеров.

Данная работа является историческим свидетельством того, что идеи линейного внимания и динамического обновления весов обсуждались в академической среде задолго до появления архитектуры Transformer от Google. Шмидхубер акцентирует внимание на том, что многие современные прорывы в области ИИ имеют глубокие корни в исследованиях нейронных сетей начала 90-х годов, направленных на решение проблемы затухающих градиентов и эффективного обучения с учителем.

Ключевые факты

  • Работа датирована 1991 годом и была подготовлена в рамках исследований в IDSIA.
  • Предложенная архитектура использует механизм «быстрых весов» для управления контекстной памятью.
  • Метод демонстрирует линейную зависимость вычислительной сложности от длины последовательности, в отличие от квадратичной сложности стандартного внимания.
  • Исследование доказывает возможность обучения сетей с памятью через градиентный спуск без использования классических механизмов нормализации, принятых в современных LLM.