Исследователи проанализировали реальную эффективность ИИ-агентов при работе с кодовыми базами после выполнения операций слияния (merge). Работа фокусируется на том, насколько успешно модели справляются с разрешением конфликтов и поддержанием работоспособности системы в условиях динамических изменений. Результаты показывают критические разрывы между теоретическими способностями моделей и их практической применимостью в сложных CI/CD пайплайнах.

Авторы работы изучили поведение популярных LLM в сценариях, где агент должен не просто написать функцию, а интегрировать её в существующий проект, учитывая контекст других коммитов. Выяснилось, что даже при высоком качестве генерации отдельных блоков кода, агенты часто допускают ошибки в архитектурной связности, которые проявляются только на этапе сборки или выполнения тестов. Это подчеркивает необходимость перехода от оценки «чистой» генерации к оценке агентной производительности в рамках жизненного цикла разработки.

Основное внимание уделено метрикам, которые позволяют оценить, насколько «осмысленно» агент взаимодействует с историей репозитория. Исследование предлагает новый подход к тестированию агентных систем, где успех измеряется не прохождением статических бенчмарков, а успешностью прохождения полного цикла интеграции кода в реальных условиях разработки.

Ключевые факты

  • Исследование сфокусировано на анализе «пост-мерж» состояния кода, созданного автономными агентами.
  • Выявлена прямая корреляция между глубиной понимания контекста репозитория и частотой возникновения регрессионных ошибок.
  • Установлено, что стандартные бенчмарки на генерацию кода не учитывают сложности, возникающие при разрешении конфликтов слияния.
  • Предложены новые метрики для оценки надежности ИИ-агентов в задачах автоматизации инженерных процессов.
  • Работа подчеркивает важность интеграции инструментов статического анализа в агентные рабочие процессы для минимизации ошибок после слияния.