Исследователи представили HiKV — метод аппаратного и алгоритмического ускорения декодирования LLM, решающий проблему нехватки памяти при работе с длинными контекстами. Система использует иерархическую оценку важности токенов для сжатия KV-кэша на двух уровнях, что позволяет значительно снизить требования к видеопамяти и повысить пропускную способность инференса без существенной потери точности генерации.
Основная сложность современных моделей с длинным контекстом заключается в линейном росте объема KV-кэша, который быстро заполняет доступную память GPU. HiKV оптимизирует этот процесс, разделяя данные на критически важные и менее значимые. Алгоритмическая часть метода динамически определяет, какие токены можно сжать или отбросить, в то время как аппаратная поддержка обеспечивает эффективную работу с разреженными структурами данных на уровне железа.
Такой подход позволяет запускать модели с контекстным окном в сотни тысяч токенов на стандартном оборудовании, где ранее это было невозможно из-за ограничений VRAM. Интеграция HiKV в пайплайны инференса дает возможность кратно увеличить количество одновременных запросов к модели, сохраняя при этом низкую задержку ответа, что критически важно для агентных систем и сложных RAG-решений.
Ключевые факты
- HiKV использует двухэтапную иерархическую стратегию сжатия KV-кэша для минимизации избыточности данных.
- Метод объединяет алгоритмическую оптимизацию выбора токенов с аппаратным ускорением обработки разреженных кэшей.
- Решение направлено на устранение главного «бутылочного горлышка» при работе с длинными контекстами — дефицита памяти GPU.
- Технология позволяет существенно повысить эффективность инференса LLM в задачах, требующих обработки больших объемов входных данных.