Исследователи представили концепцию Persistent State Machines, позволяющую интегрировать долговременную память в архитектуру LLM через использование INT4-ячеек непосредственно в оперативной памяти. Метод оптимизирует механизм внимания, позволяя моделям сохранять контекст между сессиями без необходимости полной перегенерации токенов, что существенно снижает вычислительные затраты и задержки при работе с длинными последовательностями данных.
Традиционные подходы к RAG и контекстному окну часто ограничены объемом кэша KV (Key-Value), который быстро переполняется при росте диалога. Новая архитектура переосмысливает хранение состояний, переводя их в сжатый формат INT4. Это не только экономит память, но и позволяет эффективно обновлять «состояние» модели по мере поступления новых данных, превращая статичные веса в динамически обновляемую систему памяти.
Такой подход открывает путь к созданию агентов с «постоянной памятью», которые способны накапливать опыт и знания без постоянного обращения к внешним векторным базам данных. Использование низкоразрядного квантования для хранения состояний минимизирует потери точности, сохраняя при этом высокую скорость доступа, что критически важно для систем реального времени и автономных агентных сред.
Ключевые факты
- Метод использует INT4-квантование для хранения состояний внимания, что снижает требования к объему оперативной памяти в несколько раз.
- Архитектура Persistent State Machines позволяет поддерживать контекст между независимыми запросами без пересчета всей истории.
- Технология направлена на устранение ограничений стандартного KV-кэша, который является узким местом при масштабировании длинных контекстов.
- Реализация ориентирована на повышение производительности инференса при сохранении высокой точности воспроизведения накопленных данных.