Исследователи проанализировали реальную эффективность ИИ-агентов при работе с кодовыми базами после выполнения операций слияния (merge). Работа фокусируется на том, насколько успешно модели справляются с разрешением конфликтов и поддержанием работоспособности системы в условиях динамических изменений. Результаты показывают критические разрывы между теоретическими способностями моделей и их практической применимостью в сложных CI/CD пайплайнах.
Авторы работы изучили поведение популярных LLM в сценариях, где агент должен не просто написать функцию, а интегрировать её в существующий проект, учитывая контекст других коммитов. Выяснилось, что даже при высоком качестве генерации отдельных блоков кода, агенты часто допускают ошибки в архитектурной связности, которые проявляются только на этапе сборки или выполнения тестов. Это подчеркивает необходимость перехода от оценки «чистой» генерации к оценке агентной производительности в рамках жизненного цикла разработки.
Основное внимание уделено метрикам, которые позволяют оценить, насколько «осмысленно» агент взаимодействует с историей репозитория. Исследование предлагает новый подход к тестированию агентных систем, где успех измеряется не прохождением статических бенчмарков, а успешностью прохождения полного цикла интеграции кода в реальных условиях разработки.
Ключевые факты
- Исследование сфокусировано на анализе «пост-мерж» состояния кода, созданного автономными агентами.
- Выявлена прямая корреляция между глубиной понимания контекста репозитория и частотой возникновения регрессионных ошибок.
- Установлено, что стандартные бенчмарки на генерацию кода не учитывают сложности, возникающие при разрешении конфликтов слияния.
- Предложены новые метрики для оценки надежности ИИ-агентов в задачах автоматизации инженерных процессов.
- Работа подчеркивает важность интеграции инструментов статического анализа в агентные рабочие процессы для минимизации ошибок после слияния.