Исследователи представили SWE-Bench ProMax — новый бенчмарк для оценки способностей ИИ-агентов в сложных задачах программной инженерии, таких как масштабный многоязычный рефакторинг. Проект направлен на решение проблемы насыщения существующих тестов и исправление ошибок в верификации решений, так как аудит показал, что около 60% задач в текущих наборах данных содержат некорректные или неполные критерии оценки.

Новый бенчмарк фокусируется на задачах с длинным горизонтом планирования, которые требуют от моделей глубокого понимания кодовой базы и выполнения многоэтапных изменений. В отличие от предыдущих версий, ProMax вводит более строгие протоколы тестирования, исключающие ложноотрицательные результаты, когда агент предлагает верное решение, но не проходит тест из-за его избыточной узкости или неопределенности требований.

Разработка призвана повысить качество оценки автономных систем программирования, которые всё чаще сталкиваются с реальными задачами поддержки крупных репозиториев. Авторы подчеркивают, что текущие метрики часто не учитывают контекст многоязычных сред, что делает ProMax важным инструментом для измерения прогресса в области агентной разработки ПО.

Ключевые факты

  • Около 60% задач в текущем наборе SWE-bench Verified содержат дефектные тесты, препятствующие объективной оценке.
  • SWE-Bench ProMax ориентирован на сложные задачи многоязычного рефакторинга кода.
  • Бенчмарк исправляет проблему «перенасыщения» существующих тестов, которые перестали быть индикатором реальных способностей моделей.
  • Основной акцент сделан на задачах с длинным горизонтом планирования, требующих глубокой интеграции в существующие программные проекты.