Исследователи проанализировали механизм работы KV-кэша в моделях семейства Qwen2.5, изучив влияние повторного использования промежуточных состояний на итоговый результат генерации. Эксперимент показал, что при реконструкции токенов через «stage-replay» возникают расхождения в предсказаниях по сравнению с полным пересчетом префикса. Это ставит под сомнение точность стандартных методов кэширования при выполнении сложных логических цепочек.

В работе рассматривается гипотеза о том, что продолжение генерации из сохраненного состояния декодера идентично полноценному префиллу (prefill) с теми же входными данными. Авторы провели сравнительный анализ 200 итераций, сопоставляя «живой» кэш с однократным заполнением идентичными токенами. Результаты демонстрируют, что даже при совпадении входных данных внутренние состояния модели могут отклоняться, что приводит к деградации логических выводов.

Данное исследование подчеркивает критическую важность управления точностью KV-кэша в системах, использующих длинные контексты и агентные сценарии. Разработчикам систем инференса необходимо учитывать, что оптимизации, направленные на ускорение за счет кэширования, могут вносить скрытые ошибки в процесс рассуждения модели, особенно на границах логических этапов.

Ключевые факты

  • Исследование базируется на архитектуре моделей Qwen2.5.
  • Экспериментальная выборка составила 200 независимых итераций генерации.
  • Выявлено наличие расхождений (divergence) между состоянием модели при использовании KV-кэша и при «холодном» префилле.
  • Метод «stage-replay» признан недостаточно точным для сохранения идентичности логического вывода при переключении между кэшированными состояниями.
  • Работа указывает на необходимость более строгого контроля точности (precision controls) при управлении кэшем в высоконагруженных системах.