Исследователи представили PAST-Bench — первый систематический бенчмарк для оценки способности персональных ИИ-агентов к рекурсивному самосовершенствованию. Инструмент проверяет, насколько эффективно модели используют накопленный опыт, историю задач и предпочтения пользователя для улучшения своей производительности в долгосрочной перспективе, заполняя пробел в методологии тестирования агентных систем, которые должны эволюционировать вместе с пользователем.

Основная проблема, которую решает бенчмарк, заключается в отсутствии стандартизированных метрик для оценки «обучаемости» агентов в процессе эксплуатации. В отличие от статических тестов, PAST-Bench фокусируется на динамическом сохранении навыков и адаптации к контексту пользователя. Это позволяет разработчикам понять, действительно ли агент становится полезнее со временем или просто повторяет заученные паттерны без качественного прогресса.

Методология бенчмарка включает симуляцию многосессионного взаимодействия, где агент должен демонстрировать рост эффективности при выполнении повторяющихся или усложняющихся задач. Тестирование охватывает ключевые аспекты: от извлечения предпочтений из истории до оптимизации использования инструментов и автоматизации рутинных действий. Результаты показывают, что текущие архитектуры часто сталкиваются с деградацией или стагнацией при попытке долгосрочного накопления опыта.

Ключевые факты

  • PAST-Bench оценивает способность агентов трансформировать накопленный опыт в улучшение будущих результатов.
  • Бенчмарк охватывает четыре критических параметра: сохранение предпочтений, историю задач, использование инструментов и развитие навыков.
  • Тестирование направлено на выявление разрыва между способностью модели к запоминанию и её реальной способностью к рекурсивному самосовершенствованию.
  • Исследование подчеркивает необходимость перехода от оценки разовых ответов к анализу долгосрочной адаптивности агентных систем.