Исследователи представили метод ResKV, решающий проблему потери точности при сжатии KV-кэша в LLM. В отличие от стандартных методов удаления токенов, ResKV восстанавливает вклад отброшенной информации через аппроксимацию, что позволяет сохранять качество генерации при ограниченном объеме памяти. Технология значительно повышает эффективность инференса моделей с длинным контекстом, минимизируя искажения в механизме внимания.
Традиционные подходы к сжатию кэша часто приводят к деградации ответов, так как безвозвратно удаляют данные, которые могут быть важны для последующих слоев модели. Метод слияния токенов, хотя и сохраняет больше информации, часто нарушает точность оставшихся ключей и значений. ResKV переосмысливает процесс, рассматривая пропущенную информацию как корректирующий сигнал, который можно интегрировать в оставшиеся токены.
Этот подход позволяет достичь более высоких показателей перплексии при значительном сокращении объема занимаемой оперативной памяти. Метод особенно актуален для развертывания крупных моделей на оборудовании с ограниченными ресурсами, где размер KV-кэша становится основным узким местом при обработке длинных последовательностей.
Ключевые факты
- Метод ResKV восстанавливает вклад «вытесненных» токенов, предотвращая потерю контекстной информации.
- Технология направлена на решение проблемы нехватки памяти при инференсе моделей с длинным контекстом.
- Подход позволяет избежать искажений, возникающих при использовании стандартных методов слияния (merging) или удаления (eviction) токенов.
- Алгоритм оптимизирует использование KV-кэша без необходимости дообучения базовой модели.