Исследователи представили E-Bench — специализированный бенчмарк для оценки способности LLM-агентов выполнять сложные многошаговые задачи в реальных продуктовых сценариях. В отличие от существующих тестов, сфокусированных на одиночных вызовах API, E-Bench проверяет навыки агентов по сбору скрытой информации, планированию последовательности действий и корректному изменению состояния системы в динамических средах.

Современные агентные системы часто сталкиваются с трудностями при выполнении длинных цепочек действий, где ошибка на одном этапе приводит к сбою всей задачи. E-Bench моделирует условия, приближенные к реальной разработке, требуя от моделей не просто генерации кода, а понимания контекста среды и управления состоянием. Это позволяет более точно измерять надежность агентов, которые взаимодействуют с внешними сервисами и базами данных.

Тестирование в рамках E-Bench охватывает сценарии, где агент должен самостоятельно адаптироваться к изменениям, происходящим после каждого вызова инструмента. Такой подход помогает выявить слабые места в логике планирования и обработки ошибок, что критически важно для внедрения автономных агентов в бизнес-процессы, требующие высокой точности и предсказуемости результатов.

Ключевые факты

  • E-Bench фокусируется на многошаговом использовании инструментов (multi-step tool use) в stateful-средах.
  • Основные метрики включают успешность сбора скрытых данных, точность композиции вызовов и корректность фиксации изменений состояния.
  • Бенчмарк направлен на устранение ограничений существующих тестов, которые часто ограничиваются короткими траекториями или изолированными API-запросами.
  • Методология E-Bench позволяет оценивать способность агентов к долгосрочному планированию и восстановлению после промежуточных ошибок.