Исследование выявило, что неэффективное управление временем жизни кэша (TTL) в современных LLM-сервисах приводит к восьмикратной переплате за инференс. Анализ стратегий кэширования промптов у Anthropic, OpenAI и Google показал, что стандартные настройки часто не соответствуют реальным паттернам агентных запросов, вызывая избыточные операции перезаписи и необоснованный рост расходов на инфраструктуру.

Проблема заключается в том, что большинство разработчиков полагаются на дефолтные параметры провайдеров, которые не учитывают специфику долгоживущих агентных сессий. Когда кэш вытесняется слишком быстро, модель вынуждена повторно обрабатывать контекст, что увеличивает время отклика и стоимость токенов. Оптимизация стратегии «прогрева» кэша позволяет значительно снизить накладные расходы при работе с объемными системными промптами и историей диалогов.

Авторы исследования провели замеры производительности и стоимости при различных сценариях обращения к API. Выяснилось, что даже небольшая корректировка интервалов обновления кэша позволяет существенно сократить количество «холодных» запусков, требующих полной перегенерации KV-блоков. Это критически важно для систем, где агент постоянно обращается к одним и тем же справочным данным или инструкциям в рамках одного рабочего процесса.

Ключевые факты

  • Стоимость поддержания кэша может быть снижена в 8 раз при правильной настройке TTL.
  • Исследование охватывает API-интерфейсы Anthropic, OpenAI и Google.
  • Основная причина перерасхода — преждевременное вытеснение (eviction) KV-кэша из памяти провайдера.
  • Оптимизация стратегии «keepalive» напрямую влияет на latency и бюджет агентных систем.
  • Разница в политиках кэширования между провайдерами требует индивидуальной настройки для каждого вендора.