Исследователи предложили переосмыслить управление ограниченной памятью языковых моделей как задачу статистического оценивания. Вместо эвристических методов отсечения токенов авторы рассматривают процесс как сглаживание с фиксированным лагом. Это позволяет оптимизировать выбор данных для удержания в кэше, повышая эффективность работы моделей с длинным контекстом при ограниченных аппаратных ресурсах.

Существующие методы, такие как StreamingLLM, H2O или SnapKV, принимают решения об удалении данных на основе локальных правил в момент поступления токена. Новый подход вводит понятие «лага фиксации» (commit lag), который позволяет модели отложить решение об удалении элемента до накопления достаточного объема информации о его полезности. Это превращает задачу управления памятью из реактивной фильтрации в задачу предсказания вероятности повторного использования конкретного фрагмента данных.

Математическая модель показывает, что при определенных условиях стратегия «измерения» (отложенного принятия решения) значительно превосходит стратегию «накопления» (постоянного удержания). Это критически важно для систем, работающих с потоковыми данными или длинными документами, где память является узким местом. Метод позволяет динамически адаптировать стратегию вытеснения к характеру входного потока, минимизируя потери точности при сжатии контекста.

Ключевые факты

  • Исследование переводит задачу управления памятью (KV-кэшем) из области эвристик в область теории оценивания сигналов.
  • Введено понятие «лага фиксации» (commit lag), определяющего момент принятия решения об удалении токена из рабочей памяти.
  • Метод позволяет сравнивать существующие алгоритмы (StreamingLLM, H2O, SnapKV) в единой системе координат параметров задержки.
  • Доказано, что отложенное принятие решения об удалении (измерение) эффективнее жестких стратегий накопления в условиях ограниченного контекстного окна.