Исследователи представили TREK (Travel Reasoning and Evaluation Kit) — специализированный бенчмарк для тестирования LLM-агентов в задачах сложного планирования путешествий. В отличие от стандартных тестов, TREK проверяет способность агентов учитывать множество взаимосвязанных ограничений: от доступности рейсов и отелей до соблюдения бюджета и логистической проходимости маршрута, что критически важно для реальных агентных систем.

Планирование поездки требует от модели не просто генерации текста, а работы с внешними инструментами для верификации данных в реальном времени. Агенты должны сопоставлять предпочтения пользователя с объективными фактами из баз данных, обеспечивая при этом связность и исполнимость итогового маршрута. Текущие бенчмарки часто игнорируют эти аспекты, фокусируясь на простых ответах, тогда как TREK вводит жесткие критерии валидации для каждого элемента плана.

Использование подобных инструментов позволяет разработчикам точнее оценивать надежность агентов в сценариях, где ошибка в одном звене — например, неверная дата или несуществующий рейс — делает весь результат бесполезным. Бенчмарк моделирует реальные условия эксплуатации, где агент выступает в роли полноценного ассистента, взаимодействующего с API сервисов бронирования и планирования.

Ключевые факты

  • TREK оценивает агентов по критериям доступности, бюджетной эффективности и физической реализуемости маршрута.
  • Бенчмарк фокусируется на проверке способности агентов использовать внешние инструменты для верификации данных.
  • Система учитывает многофакторные ограничения, которые часто упускаются в стандартных тестах на логику LLM.
  • Разработка направлена на повышение качества автономных систем планирования, работающих с реальными API.