Исследователи представили концепцию Sparse Event-KV, пересматривающую принципы работы KV-кэша в долгосрочных ИИ-агентах. Авторы изучили эффективность хранения выборочных данных в кэше при удалении исходных наблюдений. Результаты показывают, что сохранение отдельных событий остается информативным для модели даже при потере контекста, что позволяет оптимизировать использование памяти без существенной потери качества генерации ответов в агентных системах.
Современные системы обслуживания моделей часто используют стратегии вытеснения (eviction) для управления KV-кэшем, однако теоретическое обоснование того, какие именно данные стоит сохранять, до сих пор оставалось недостаточно изученным. Работа фокусируется на «контракте памяти», где агент должен эффективно распределять вычислительные ресурсы, сохраняя только наиболее значимые фрагменты истории взаимодействий.
Эксперименты подтверждают, что частичное сохранение кэша позволяет агентам поддерживать высокую производительность при работе с длинными контекстами. Это открывает путь к созданию более масштабируемых архитектур, где память не просто накапливается линейно, а динамически фильтруется на основе значимости событий, что критически важно для снижения нагрузки на инфраструктуру инференса.
Ключевые факты
- Исследование проверяет гипотезу о том, что удержание выборочных событий в KV-кэше сохраняет информативность модели после удаления исходных наблюдений.
- Метод направлен на оптимизацию систем обслуживания (serving systems), работающих с долгосрочными агентами и ограниченными ресурсами памяти.
- Работа ставит под сомнение текущие подходы к вытеснению данных, предлагая более строгий «контракт памяти» для агентных систем.
- Результаты исследования опубликованы на платформе arXiv под номером 2607.23693v1.