Проект SWE-rebench представил комплексное сравнение 13 языковых моделей и 4 агентских систем при решении задач по исправлению реальных программных ошибок. Исследование охватывает пять популярных языков программирования: Go, Java, Python, Rust и TypeScript. Бенчмарк позволяет оценить способность ИИ-агентов ориентироваться в сложных кодовых базах и выполнять автономные правки в репозиториях.
Авторы проекта сфокусировались на создании стандартизированной среды, которая имитирует реальный процесс разработки. В отличие от простых задач на написание функций, здесь агенты должны анализировать контекст проекта, находить причину бага и предлагать корректный патч. Это дает более точное представление о применимости современных LLM в профессиональной инженерной среде.
Результаты показывают значительный разрыв в производительности между моделями при работе с разными стеками технологий. Исследование подчеркивает, что выбор языка программирования существенно влияет на успешность выполнения агентских задач, что требует от разработчиков более тщательного подбора инструментов под конкретные инфраструктурные требования проекта.
Ключевые факты
- В бенчмарк включены 13 различных моделей и 4 специализированных агентских фреймворка.
- Оценка проводится на задачах для пяти языков: Go, Java, Python, Rust и TypeScript.
- Тестирование базируется на реальных кейсах из популярных open-source репозиториев.
- Основная метрика — способность агента автономно находить и исправлять ошибки в коде.
- Платформа предоставляет открытый доступ к методологии для воспроизведения результатов тестирования.