Исследователи представили Zero-Mem — архитектурный подход, позволяющий ИИ-агентам выполнять операции с памятью без расходования контекстных токенов. Метод переносит управление данными на уровень внешних операций, исключая необходимость постоянной пересылки истории взаимодействий в промпт. Это радикально снижает задержки и стоимость инференса, сохраняя при этом способность агентов к долгосрочному запоминанию контекста и выполнению сложных задач.
Традиционные системы RAG и агентной памяти часто перегружают контекстное окно LLM, что приводит к росту затрат на каждый запрос и деградации внимания модели при работе с большими объемами данных. Zero-Mem предлагает механизм «нулевых токенов», где доступ к информации осуществляется через специализированные операции, которые не требуют включения содержимого памяти в основной поток генерации модели.
Такой подход позволяет масштабировать агентные системы до работы с огромными базами знаний, не жертвуя скоростью отклика. Технология особенно эффективна для автономных агентов, требующих постоянного доступа к структурированным данным или логам прошлых сессий, так как она минимизирует «шум» в контексте и позволяет модели фокусироваться исключительно на текущей задаче.
Ключевые факты
- Zero-Mem исключает необходимость передачи данных из памяти в контекстное окно модели, что экономит 100% токенов на операциях извлечения.
- Метод снижает общую задержку (latency) системы при работе с длинными цепочками рассуждений агента.
- Архитектура поддерживает интеграцию с существующими векторными базами данных без изменения их структуры.
- Технология ориентирована на снижение стоимости эксплуатации LLM-агентов в высоконагруженных продакшн-системах.