Юрген Шмидхубер представил архивную работу 1991 года, в которой описывается архитектура, предвосхищающая современные линейные трансформеры. Автор демонстрирует, как использование ненормализованных весов и специфических механизмов внимания позволяет эффективно моделировать последовательности. Исследование подчеркивает фундаментальную связь между ранними рекуррентными нейронными сетями и современными методами обработки данных с линейной сложностью вычислений.
В публикации детально разбирается подход, основанный на «быстрых весах» (fast weights), которые позволяют сети динамически адаптироваться к контексту без необходимости изменения основных параметров модели. Этот метод позволяет нейронной сети хранить информацию о недавних событиях во временных весах, что концептуально близко к тому, как работают современные механизмы внимания в архитектурах трансформеров.
Данная работа является историческим свидетельством того, что идеи линейного внимания и динамического обновления весов обсуждались в академической среде задолго до появления архитектуры Transformer от Google. Шмидхубер акцентирует внимание на том, что многие современные прорывы в области ИИ имеют глубокие корни в исследованиях нейронных сетей начала 90-х годов, направленных на решение проблемы затухающих градиентов и эффективного обучения с учителем.
Ключевые факты
- Работа датирована 1991 годом и была подготовлена в рамках исследований в IDSIA.
- Предложенная архитектура использует механизм «быстрых весов» для управления контекстной памятью.
- Метод демонстрирует линейную зависимость вычислительной сложности от длины последовательности, в отличие от квадратичной сложности стандартного внимания.
- Исследование доказывает возможность обучения сетей с памятью через градиентный спуск без использования классических механизмов нормализации, принятых в современных LLM.