Разработчики представили AI2Work — специализированный бенчмарк для тестирования ИИ-агентов в условиях реальных офисных задач. Инструмент оценивает способность моделей работать с файлами, браузером и корпоративным софтом. В ходе создания проекта авторы выявили четыре критические ошибки в логике работы автоматизированных систем оценки, что подчеркивает сложность верификации агентных решений в неструктурированной среде.
Бенчмарк фокусируется на многошаговых процессах, которые требуют от агента не только понимания контекста, но и взаимодействия с внешними интерфейсами. В отличие от стандартных тестов на логику или написание кода, AI2Work имитирует повседневные рабочие сценарии, такие как поиск информации в документах, заполнение форм и управление системными настройками. Это позволяет более точно измерять реальную автономность агентов в бизнес-процессах.
Особое внимание в проекте уделено методологии «судьи» (judge), который проверяет корректность действий агента. Авторы обнаружили, что стандартные подходы к оценке часто страдают от предвзятости или неспособности распознать промежуточные ошибки, которые не влияют на финальный результат, но критичны для безопасности и стабильности работы. Исправление этих багов позволило создать более надежный фреймворк для сравнения производительности различных LLM в агентных задачах.
Ключевые факты
- AI2Work оценивает способность ИИ-агентов выполнять офисные задачи, включая работу с файловой системой и веб-интерфейсами.
- В процессе разработки бенчмарка выявлено 4 системные ошибки в алгоритмах оценки (judge), которые приводили к искажению результатов.
- Инструмент ориентирован на проверку многошаговых сценариев, требующих от модели принятия решений в реальном времени.
- Проект доступен в формате open-source для тестирования различных архитектур агентов и моделей.
- Основная цель бенчмарка — устранение разрыва между теоретическими способностями LLM и их практической применимостью в офисной автоматизации.