Исследователи представили концепцию персистентных машин состояний (Persistent State Machines) для управления механизмом внимания в LLM. Подход направлен на радикальное снижение энергопотребления при выполнении операций инференса, достигая показателя 0,0267 пДж на операцию (PJ/Op) при моделировании на базе Vivado. Это решение предлагает новый способ организации памяти и вычислений для агентных систем, работающих с длинным контекстом.
Традиционные архитектуры трансформеров требуют значительных затрат ресурсов на пересчет весов внимания при каждом новом токене. Использование персистентных состояний позволяет сохранять промежуточные вычисления в специализированных структурах, минимизируя обращения к основной памяти и повышая общую энергоэффективность аппаратных ускорителей. Данный метод особенно актуален для локального запуска моделей на устройствах с ограниченным питанием.
Разработка фокусируется на аппаратной реализации алгоритмов внимания, что критически важно для создания автономных агентов, требующих постоянной работы в фоновом режиме. Переход от классических матричных вычислений к потоковой обработке состояний позволяет оптимизировать пайплайны данных, снижая задержки и тепловыделение чипов при выполнении сложных логических задач.
Ключевые факты
- Энергоэффективность инференса достигает 0,0267 пДж на операцию (PJ/Op).
- Методология базируется на использовании персистентных машин состояний для управления механизмом внимания.
- Оценка производительности и энергопотребления проводилась с использованием среды проектирования Vivado.
- Подход ориентирован на снижение накладных расходов при обработке длинных последовательностей в LLM.