Исследование 32 сессий работы Claude Code показало критическую неэффективность текущих методов управления контекстом. Около 96,8% всех потребляемых токенов расходуется на повторное чтение истории переписки и логов, а не на генерацию нового кода. Это выявляет острую проблему избыточности в агентных системах, работающих с длинными контекстными окнами и частыми итерациями.
Основная причина такого высокого расхода заключается в архитектуре взаимодействия, где агент при каждом новом запросе вынужден перечитывать весь накопленный лог сессии для поддержания актуального состояния. В условиях текущих моделей оплаты за входные токены, такая модель работы приводит к неоправданно высоким затратам и замедлению отклика системы, так как значительная часть вычислительных мощностей тратится на обработку уже известных данных.
Для оптимизации агентных систем требуется переход к более эффективным методам управления памятью, таким как суммаризация истории, использование векторных баз данных для поиска релевантных фрагментов или внедрение кэширования контекста. Без изменения подходов к хранению и извлечению истории, масштабирование сложных агентных процессов остается экономически невыгодным из-за экспоненциального роста стоимости при увеличении длительности сессии.
Ключевые факты
- Проанализировано 32 полных сессии использования Claude Code для разработки ПО.
- 96,8% от общего объема потребленных токенов приходится на повторное чтение истории диалога.
- Высокая доля расходов на «чтение» делает текущие агентные процессы крайне затратными при работе над объемными проектами.
- Исследование подчеркивает необходимость внедрения механизмов селективного контекста вместо передачи всей истории целиком.