Исследователи предложили метод переноса KV-кэша между моделями одного семейства, что позволяет избежать повторного вычисления префилла при переключении между моделями разного размера. Использование линейного отображения кэша позволяет передавать контекст от одной модели к другой, существенно сокращая задержки при динамической маршрутизации запросов и каскадировании моделей в продакшн-системах.

В современных архитектурах LLM переключение между моделями в рамках одной сессии требует повторной обработки всей истории диалога, что создает значительные накладные расходы на вычисления. Новый подход использует математическую закономерность, согласно которой KV-кэши моделей одного семейства обладают линейной структурой. Это позволяет трансформировать кэш «исходной» модели в формат, пригодный для «целевой» модели, даже если они различаются по количеству слоев или размерности скрытых состояний.

Данная технология критически важна для систем, где стоимость и качество ответов балансируются в реальном времени. Вместо того чтобы тратить ресурсы на повторный префилл (prefill) при переходе от быстрой, но менее точной модели к более мощной, система просто адаптирует уже накопленный контекст. Это открывает возможности для более эффективного использования вычислительных мощностей в агентных платформах и сервисах с высокой частотой смены моделей.

Ключевые факты

  • Метод позволяет переносить KV-кэш между моделями разного размера внутри одного семейства без потери контекста.
  • Использование линейного отображения исключает необходимость повторного префилла при смене модели.
  • Технология оптимизирует работу систем с динамической маршрутизацией запросов и каскадированием моделей.
  • Подход значительно снижает latency при переключении между моделями в ходе одного диалога.