Исследователи проанализировали механизм работы KV-кэша в моделях семейства Qwen2.5, изучив влияние повторного использования промежуточных состояний на итоговый результат генерации. Эксперимент показал, что при реконструкции токенов через «stage-replay» возникают расхождения в предсказаниях по сравнению с полным пересчетом префикса. Это ставит под сомнение точность стандартных методов кэширования при выполнении сложных логических цепочек.
В работе рассматривается гипотеза о том, что продолжение генерации из сохраненного состояния декодера идентично полноценному префиллу (prefill) с теми же входными данными. Авторы провели сравнительный анализ 200 итераций, сопоставляя «живой» кэш с однократным заполнением идентичными токенами. Результаты демонстрируют, что даже при совпадении входных данных внутренние состояния модели могут отклоняться, что приводит к деградации логических выводов.
Данное исследование подчеркивает критическую важность управления точностью KV-кэша в системах, использующих длинные контексты и агентные сценарии. Разработчикам систем инференса необходимо учитывать, что оптимизации, направленные на ускорение за счет кэширования, могут вносить скрытые ошибки в процесс рассуждения модели, особенно на границах логических этапов.
Ключевые факты
- Исследование базируется на архитектуре моделей Qwen2.5.
- Экспериментальная выборка составила 200 независимых итераций генерации.
- Выявлено наличие расхождений (divergence) между состоянием модели при использовании KV-кэша и при «холодном» префилле.
- Метод «stage-replay» признан недостаточно точным для сохранения идентичности логического вывода при переключении между кэшированными состояниями.
- Работа указывает на необходимость более строгого контроля точности (precision controls) при управлении кэшем в высоконагруженных системах.