Исследователи представили FinEvo-Bench — первый лонгитюдный бенчмарк для оценки способности ИИ-агентов накапливать опыт в профессиональных финансовых процессах. В отличие от статических тестов, система отслеживает, как выполнение предыдущих задач влияет на эффективность агента в последующих. Набор включает 120 реальных кейсов из 20 бизнес-сценариев, охватывающих шесть ключевых направлений финансовой индустрии.

Существующие методы тестирования ИИ-агентов часто ограничиваются разовыми задачами, не учитывая долгосрочную адаптацию и накопление знаний. FinEvo-Bench заполняет этот пробел, предлагая многоаспектную оценку качества работы, которая требует от моделей не просто следования инструкциям, но и понимания контекста сложных профессиональных рабочих процессов. Это позволяет измерить прогресс агента в условиях, максимально приближенных к реальной корпоративной среде.

Бенчмарк фокусируется на открытых задачах, где результат не всегда имеет единственно верный ответ, что критически важно для финансового сектора. Оценка проводится по нескольким критериям, включая точность анализа, соблюдение регуляторных норм и качество итоговых документов. Такой подход помогает разработчикам понять, насколько эффективно модели обучаются на собственных ошибках и успехах в рамках длительных цепочек операций.

Ключевые факты

  • FinEvo-Bench содержит 120 задач, основанных на реальных финансовых кейсах.
  • Охват включает 20 различных бизнес-сценариев в шести финансовых доменах.
  • Тест оценивает способность агентов к самоэволюции через накопление опыта в последовательных задачах.
  • Методология ориентирована на профессиональные рабочие процессы с открытыми результатами и многокритериальной оценкой.