Разработчики агентных систем представили методику оптимизации промптов и структуры взаимодействия, позволившую сократить расход токенов на 50% при выполнении 36 последовательных вызовов инструментов. Оптимизация достигнута за счет переработки системных промптов, удаления избыточных метаданных и внедрения более компактных форматов передачи контекста, что напрямую снижает стоимость инференса и задержки в работе агента.
Основная проблема агентных систем заключается в «раздувании» контекста при многократном обращении к внешним функциям. В ходе экспериментов выяснилось, что стандартные подходы к описанию API и формату ответов модели содержат значительный объем повторяющейся технической информации. Устранение этих избыточных данных позволяет модели быстрее фокусироваться на логике решения задачи, сохраняя при этом точность выполнения кода.
Метод фокусируется на минимизации «шума» в диалоговом окне между агентом и средой исполнения. Авторы пересмотрели способ представления документации инструментов и результатов их выполнения, перейдя к более сжатым представлениям. Это не только экономит бюджет на API, но и повышает общую производительность системы, так как модель тратит меньше времени на обработку нерелевантных токенов в каждом цикле рассуждений.
Ключевые факты
- Достигнуто снижение потребления токенов на 50% для сценариев, требующих 36 последовательных вызовов инструментов.
- Оптимизация реализована через очистку системных промптов от избыточных описаний API.
- Сокращение объема данных в контексте позволило повысить скорость отклика агента без потери качества выполнения задач.
- Метод ориентирован на снижение операционных расходов при масштабировании агентных систем в продакшене.