Исследователи представили метод квантования KV-кэша до 2 бит (INT2), который позволяет существенно сократить потребление видеопамяти при работе с длинными контекстами. Технология сохраняет высокую точность генерации, практически не уступая стандартным методам с более высокой разрядностью, что открывает возможности для запуска моделей с огромным контекстным окном на потребительском оборудовании с ограниченным объемом VRAM.
Основная проблема при работе с длинными последовательностями в LLM заключается в стремительном росте KV-кэша, который занимает значительную часть видеопамяти. Традиционные подходы к квантованию часто приводили к деградации качества ответов модели. Новый метод оптимизирует хранение ключей и значений, минимизируя потери информации при сжатии данных до минимально возможного уровня в 2 бита.
Внедрение подобных решений критически важно для масштабирования агентных систем, требующих удержания больших объемов данных в оперативной памяти для долгосрочного планирования и анализа контекста. Снижение требований к памяти позволяет либо увеличить длину контекстного окна в несколько раз на текущем железе, либо значительно повысить плотность инференса на серверных мощностях.
Ключевые факты
- Метод INT2-квантования позволяет сжимать KV-кэш до 2 бит без существенной потери качества генерации.
- Технология решает проблему нехватки VRAM при обработке длинных контекстов, характерных для современных агентных архитектур.
- Использование квантования снижает требования к пропускной способности памяти, что ускоряет время отклика модели при работе с большими массивами данных.
- Подход применим для широкого спектра архитектур трансформеров, обеспечивая баланс между эффективностью использования ресурсов и точностью вычислений.