Исследователи предложили новый подход к управлению KV-кэшем в LLM, решающий проблему непредсказуемых ошибок при удалении токенов. Традиционные детерминированные методы удаления часто приводят к неконтролируемому росту погрешности вычислений внимания. Авторы доказали, что рандомизированное проектирование позволяет восстановить консистентность оценок ошибки, обеспечивая более надежную работу систем инференса при ограничении памяти.

При стандартном подходе (top-k) система удаляет токены с низким показателем важности, не имея возможности оценить реальное влияние этого процесса на итоговый результат. Математический анализ показал, что при детерминированном подходе можно изменить удаленные значения так, что сохраненные данные останутся прежними, а ошибка вывода возрастет произвольно. Это делает невозможным создание надежного оценщика ошибки в реальном времени.

Внедрение рандомизированных стратегий позволяет обойти это фундаментальное ограничение. Метод «сертификатов ошибки» дает возможность системе инференса получать статистически обоснованные гарантии качества генерации даже при значительном сокращении объема KV-кэша. Это критически важно для оптимизации длинных контекстов в продакшн-системах, где экономия видеопамяти напрямую влияет на стоимость и скорость обслуживания запросов.

Ключевые факты

  • Детерминированные методы удаления KV-кэша (top-k) математически неспособны гарантировать точность, так как ошибка может расти бесконтрольно при неизменных сохраненных данных.
  • Предложенный метод рандомизированного проектирования позволяет создавать «сертификаты ошибки», обеспечивающие консистентную оценку качества вывода.
  • Исследование доказывает, что при использовании случайных стратегий удаления можно получить теоретические гарантии на отклонение внимания (attention-output error).
  • Работа предлагает решение для масштабирования LLM с длинным контекстом без потери контроля над точностью модели при агрессивном сжатии кэша.