Исследователи представили SWE-Touch — первый бенчмарк для оценки ИИ-агентов, работающих в общих репозиториях вместе с человеком. В отличие от существующих тестов, где агент действует изолированно, SWE-Touch моделирует реальные сценарии разработки, требующие от модели адаптации к изменениям кода, внесенным пользователем в процессе выполнения задачи, что критически важно для оценки автономных инструментов программирования.
Существующие подходы к тестированию агентных систем часто игнорируют динамическую природу разработки, ограничивая взаимодействие текстовыми сообщениями. SWE-Touch заполняет этот пробел, предлагая среду, в которой агент должен не только писать код, но и отслеживать внешние правки, разрешать конфликты и синхронизировать свои действия с текущим состоянием проекта. Это позволяет измерить устойчивость агентов к непредсказуемым изменениям в кодовой базе.
Внедрение подобных бенчмарков необходимо для перехода от лабораторных экспериментов к реальной интеграции ИИ в процессы разработки ПО. Способность агента «чувствовать» контекст и реагировать на вмешательство разработчика становится ключевым показателем его зрелости и пригодности для использования в корпоративных средах, где над одним репозиторием одновременно работают люди и автоматизированные системы.
Ключевые факты
- SWE-Touch оценивает способность агентов работать в условиях конкурентного доступа к кодовой базе.
- Бенчмарк фокусируется на сценариях, где пользователь вносит изменения в код параллельно с работой ИИ-агента.
- Тестирование направлено на выявление навыков агента по разрешению конфликтов и поддержанию консистентности проекта.
- Исследование подчеркивает разрыв между текущими возможностями моделей и требованиями реальной разработки ПО.