Исследователи представили Computer Anthology — постоянно обновляемое семейство бенчмарков, предназначенное для оценки способностей ИИ-агентов выполнять задачи в терминальной среде. Проект фокусируется на реалистичных сценариях взаимодействия с компьютером, требующих от моделей не просто генерации текста, а последовательного выполнения команд, навигации по файловым системам и решения прикладных задач в реальном времени.

В отличие от статических тестов, которые быстро устаревают из-за утечки данных в обучающие выборки, Computer Anthology делает ставку на динамичность. Система включает задачи разной сложности: от базового управления файлами до комплексного программирования и отладки. Это позволяет разработчикам точнее измерять прогресс в области агентных систем, которые должны автономно оперировать в операционных системах.

Методология бенчмарка опирается на воспроизводимые среды, где действия агента фиксируются и анализируются на предмет корректности выполнения поставленной цели. Такой подход помогает выявить реальные пробелы в логике планирования и долгосрочной памяти моделей, что критически важно для перехода от чат-ботов к полноценным цифровым помощникам, способным брать на себя рутинные компьютерные операции.

Ключевые факты

  • Computer Anthology представляет собой динамически развивающийся набор тестов, исключающий проблему «заучивания» ответов моделями.
  • Основной фокус бенчмарка направлен на терминальные задачи, требующие работы с командной строкой и файловой структурой.
  • Система оценивает способность агентов к многошаговому планированию и исправлению ошибок в процессе выполнения цепочки действий.
  • Проект нацелен на стандартизацию оценки агентных систем, работающих в реальных операционных средах.