Исследователи представили DeepSWE — специализированный бенчмарк для оценки способностей ИИ-агентов в решении реальных задач программирования. В отличие от предыдущих тестов, ориентированных на написание отдельных функций, DeepSWE фокусируется на комплексных изменениях в кодовой базе, требующих навигации по репозиториям, понимания контекста проекта и выполнения многоэтапных правок, что лучше отражает реальную работу инженеров.
Разработка бенчмарка стала ответом на проблему «загрязнения» данных, когда модели обучаются на задачах, используемых для их тестирования. DeepSWE включает в себя тщательно отобранные и верифицированные задачи из популярных open-source проектов, что позволяет объективно измерять прогресс в автономном написании кода, исправлении багов и рефакторинге. Инструмент предоставляет стандартизированную среду для сравнения эффективности различных LLM в условиях, максимально приближенных к рабочим процессам разработки.
Использование DeepSWE помогает разработчикам и исследователям точнее определять границы возможностей текущих агентных систем. Бенчмарк оценивает не только точность генерации кода, но и способность агента взаимодействовать с файловой системой, запускать тесты и анализировать логи ошибок, что является критически важным для автоматизации жизненного цикла разработки программного обеспечения.
Ключевые факты
- DeepSWE ориентирован на оценку сквозных задач, требующих внесения изменений в несколько файлов проекта.
- Бенчмарк использует реальные задачи из репозиториев с открытым исходным кодом для минимизации предвзятости моделей.
- В процессе тестирования оценивается способность агента к автономному запуску тестов и интерпретации результатов для итеративного исправления кода.
- Инструмент направлен на устранение проблемы утечки данных, характерной для классических наборов тестов вроде HumanEval или MBPP.