Исследователи представили концепцию персистентных машин состояний (Persistent State Machines) для управления механизмом внимания в LLM. Подход направлен на радикальное снижение энергопотребления при выполнении операций инференса, достигая показателя 0,0267 пДж на операцию (PJ/Op) при моделировании на базе Vivado. Это решение предлагает новый способ организации памяти и вычислений для агентных систем, работающих с длинным контекстом.

Традиционные архитектуры трансформеров требуют значительных затрат ресурсов на пересчет весов внимания при каждом новом токене. Использование персистентных состояний позволяет сохранять промежуточные вычисления в специализированных структурах, минимизируя обращения к основной памяти и повышая общую энергоэффективность аппаратных ускорителей. Данный метод особенно актуален для локального запуска моделей на устройствах с ограниченным питанием.

Разработка фокусируется на аппаратной реализации алгоритмов внимания, что критически важно для создания автономных агентов, требующих постоянной работы в фоновом режиме. Переход от классических матричных вычислений к потоковой обработке состояний позволяет оптимизировать пайплайны данных, снижая задержки и тепловыделение чипов при выполнении сложных логических задач.

Ключевые факты

  • Энергоэффективность инференса достигает 0,0267 пДж на операцию (PJ/Op).
  • Методология базируется на использовании персистентных машин состояний для управления механизмом внимания.
  • Оценка производительности и энергопотребления проводилась с использованием среды проектирования Vivado.
  • Подход ориентирован на снижение накладных расходов при обработке длинных последовательностей в LLM.