Исследователи представили PAIChecker — инструмент для анализа несоответствий между задачами и их решениями в популярных бенчмарках для оценки ИИ-агентов, таких как SWE-bench. Анализ показал, что значительная часть данных содержит ошибки связки PR и тикетов, что искажает реальные показатели способностей моделей к написанию кода и решению программных проблем в реальных репозиториях.

Стандартная методология оценки ИИ-агентов опирается на предположение, что патч в Pull Request является эталонным решением для конкретной задачи, описанной в issue. Однако авторы работы обнаружили, что автоматическое извлечение ссылок на задачи из описаний PR часто приводит к ложным связкам. В результате модели оцениваются на основе некорректных или неполных условий, что ставит под сомнение точность текущих рейтингов LLM в задачах разработки ПО.

PAIChecker позволяет автоматически проверять консистентность данных, выявляя случаи, когда описание проблемы не соответствует внесенным изменениям. Это критически важно для индустрии, так как разработчики инструментов автоматизации опираются на SWE-bench для настройки агентов. Использование «зашумленных» данных ведет к переобучению моделей на неверных паттернах и завышенным ожиданиям от их автономности.

Ключевые факты

  • Инструмент PAIChecker выявляет расхождения между описанием проблемы (issue) и патчем (PR) в наборах данных для оценки ИИ.
  • Ошибки связки возникают из-за автоматизированных пайплайнов, которые некорректно интерпретируют ссылки в описаниях Pull Request.
  • Исследование ставит под сомнение надежность текущих метрик SWE-bench, используемых для измерения прогресса в области AI Software Engineering.
  • Использование некорректных данных в бенчмарках приводит к искажению реальной производительности моделей при решении задач в реальных проектах.