Исследователи представили метод ResKV, решающий проблему потери точности при сжатии KV-кэша в LLM. В отличие от стандартных методов удаления токенов, ResKV восстанавливает вклад отброшенной информации через аппроксимацию, что позволяет сохранять качество генерации при ограниченном объеме памяти. Технология значительно повышает эффективность инференса моделей с длинным контекстом, минимизируя искажения в механизме внимания.

Традиционные подходы к сжатию кэша часто приводят к деградации ответов, так как безвозвратно удаляют данные, которые могут быть важны для последующих слоев модели. Метод слияния токенов, хотя и сохраняет больше информации, часто нарушает точность оставшихся ключей и значений. ResKV переосмысливает процесс, рассматривая пропущенную информацию как корректирующий сигнал, который можно интегрировать в оставшиеся токены.

Этот подход позволяет достичь более высоких показателей перплексии при значительном сокращении объема занимаемой оперативной памяти. Метод особенно актуален для развертывания крупных моделей на оборудовании с ограниченными ресурсами, где размер KV-кэша становится основным узким местом при обработке длинных последовательностей.

Ключевые факты

  • Метод ResKV восстанавливает вклад «вытесненных» токенов, предотвращая потерю контекстной информации.
  • Технология направлена на решение проблемы нехватки памяти при инференсе моделей с длинным контекстом.
  • Подход позволяет избежать искажений, возникающих при использовании стандартных методов слияния (merging) или удаления (eviction) токенов.
  • Алгоритм оптимизирует использование KV-кэша без необходимости дообучения базовой модели.