Исследование выявило, что неэффективное управление временем жизни кэша (TTL) в современных LLM-сервисах приводит к восьмикратной переплате за инференс. Анализ стратегий кэширования промптов у Anthropic, OpenAI и Google показал, что стандартные настройки часто не соответствуют реальным паттернам агентных запросов, вызывая избыточные операции перезаписи и необоснованный рост расходов на инфраструктуру.
Проблема заключается в том, что большинство разработчиков полагаются на дефолтные параметры провайдеров, которые не учитывают специфику долгоживущих агентных сессий. Когда кэш вытесняется слишком быстро, модель вынуждена повторно обрабатывать контекст, что увеличивает время отклика и стоимость токенов. Оптимизация стратегии «прогрева» кэша позволяет значительно снизить накладные расходы при работе с объемными системными промптами и историей диалогов.
Авторы исследования провели замеры производительности и стоимости при различных сценариях обращения к API. Выяснилось, что даже небольшая корректировка интервалов обновления кэша позволяет существенно сократить количество «холодных» запусков, требующих полной перегенерации KV-блоков. Это критически важно для систем, где агент постоянно обращается к одним и тем же справочным данным или инструкциям в рамках одного рабочего процесса.
Ключевые факты
- Стоимость поддержания кэша может быть снижена в 8 раз при правильной настройке TTL.
- Исследование охватывает API-интерфейсы Anthropic, OpenAI и Google.
- Основная причина перерасхода — преждевременное вытеснение (eviction) KV-кэша из памяти провайдера.
- Оптимизация стратегии «keepalive» напрямую влияет на latency и бюджет агентных систем.
- Разница в политиках кэширования между провайдерами требует индивидуальной настройки для каждого вендора.