Исследователи представили DeepSWE — специализированный бенчмарк для оценки способностей ИИ-агентов в решении реальных задач программирования. В отличие от предыдущих тестов, ориентированных на написание отдельных функций, DeepSWE фокусируется на комплексных изменениях в кодовой базе, требующих навигации по репозиториям, понимания контекста проекта и выполнения многоэтапных правок, что лучше отражает реальную работу инженеров.

Разработка бенчмарка стала ответом на проблему «загрязнения» данных, когда модели обучаются на задачах, используемых для их тестирования. DeepSWE включает в себя тщательно отобранные и верифицированные задачи из популярных open-source проектов, что позволяет объективно измерять прогресс в автономном написании кода, исправлении багов и рефакторинге. Инструмент предоставляет стандартизированную среду для сравнения эффективности различных LLM в условиях, максимально приближенных к рабочим процессам разработки.

Использование DeepSWE помогает разработчикам и исследователям точнее определять границы возможностей текущих агентных систем. Бенчмарк оценивает не только точность генерации кода, но и способность агента взаимодействовать с файловой системой, запускать тесты и анализировать логи ошибок, что является критически важным для автоматизации жизненного цикла разработки программного обеспечения.

Ключевые факты

  • DeepSWE ориентирован на оценку сквозных задач, требующих внесения изменений в несколько файлов проекта.
  • Бенчмарк использует реальные задачи из репозиториев с открытым исходным кодом для минимизации предвзятости моделей.
  • В процессе тестирования оценивается способность агента к автономному запуску тестов и интерпретации результатов для итеративного исправления кода.
  • Инструмент направлен на устранение проблемы утечки данных, характерной для классических наборов тестов вроде HumanEval или MBPP.