Tencent запустила WorkBuddy Bench — специализированный бенчмарк для оценки способностей ИИ-агентов в задачах разработки программного обеспечения. Платформа фокусируется на проверке навыков написания кода, отладки и выполнения комплексных инженерных задач в реальных репозиториях. Инструмент призван стандартизировать тестирование агентных систем, которые способны автономно взаимодействовать с файловой системой и средой разработки для решения задач программирования.

В отличие от классических тестов, которые оценивают генерацию отдельных функций или фрагментов кода, WorkBuddy Bench имитирует рабочий процесс инженера. Агенты должны самостоятельно ориентироваться в структуре проекта, анализировать зависимости и вносить изменения, которые проходят проверку через автоматизированные тесты. Это позволяет оценить не только качество написанного кода, но и способность модели планировать действия и исправлять ошибки в контексте существующей кодовой базы.

Разработчики бенчмарка стремятся закрыть разрыв между теоретическими навыками моделей и их практической применимостью в реальных проектах. Платформа предоставляет метрики, отражающие успешность выполнения задач в условиях ограниченного времени и ресурсов, что критически важно для внедрения агентных решений в корпоративную разработку. Результаты тестирования публикуются в открытом лидерборде, позволяя сравнивать эффективность различных LLM и агентных фреймворков.

Ключевые факты

  • WorkBuddy Bench оценивает способность ИИ-агентов работать с реальными репозиториями, а не с изолированными задачами.
  • Основные метрики включают точность выполнения кода, прохождение тестов и эффективность взаимодействия с файловой системой.
  • Платформа ориентирована на автоматизацию сложных инженерных процессов, требующих многошагового планирования.
  • Лидерборд позволяет отслеживать прогресс различных моделей в задачах автоматизированного программирования.
  • Инструмент разработан компанией Tencent для стандартизации оценки агентных систем в индустрии разработки ПО.