Tencent запустила WorkBuddy Bench — специализированный бенчмарк для оценки способностей ИИ-агентов в задачах разработки программного обеспечения. Платформа фокусируется на проверке навыков написания кода, отладки и выполнения комплексных инженерных задач в реальных репозиториях. Инструмент призван стандартизировать тестирование агентных систем, которые способны автономно взаимодействовать с файловой системой и средой разработки для решения задач программирования.
В отличие от классических тестов, которые оценивают генерацию отдельных функций или фрагментов кода, WorkBuddy Bench имитирует рабочий процесс инженера. Агенты должны самостоятельно ориентироваться в структуре проекта, анализировать зависимости и вносить изменения, которые проходят проверку через автоматизированные тесты. Это позволяет оценить не только качество написанного кода, но и способность модели планировать действия и исправлять ошибки в контексте существующей кодовой базы.
Разработчики бенчмарка стремятся закрыть разрыв между теоретическими навыками моделей и их практической применимостью в реальных проектах. Платформа предоставляет метрики, отражающие успешность выполнения задач в условиях ограниченного времени и ресурсов, что критически важно для внедрения агентных решений в корпоративную разработку. Результаты тестирования публикуются в открытом лидерборде, позволяя сравнивать эффективность различных LLM и агентных фреймворков.
Ключевые факты
- WorkBuddy Bench оценивает способность ИИ-агентов работать с реальными репозиториями, а не с изолированными задачами.
- Основные метрики включают точность выполнения кода, прохождение тестов и эффективность взаимодействия с файловой системой.
- Платформа ориентирована на автоматизацию сложных инженерных процессов, требующих многошагового планирования.
- Лидерборд позволяет отслеживать прогресс различных моделей в задачах автоматизированного программирования.
- Инструмент разработан компанией Tencent для стандартизации оценки агентных систем в индустрии разработки ПО.