Исследователи представили ORCA-bench — новый бенчмарк для оценки способности ИИ-агентов проводить анализ первопричин (RCA) в условиях эксплуатации систем. В отличие от стандартных задач по написанию кода, ORCA-bench моделирует реальную работу дежурного инженера, требуя от моделей интерпретации зашумленных метрик, логов и трассировок для диагностики инцидентов по неполным пользовательским отчетам.

Современные языковые модели демонстрируют успехи в написании и исправлении кода, однако процесс устранения инцидентов требует принципиально иных навыков: контекстуального мышления и работы с разрозненными данными в условиях высокой неопределенности. ORCA-bench создает среду, максимально приближенную к производственной, где агент должен последовательно исследовать систему, чтобы выявить корень проблемы, возникшей спустя время после начала сбоя.

Этот инструмент позволяет оценить, насколько текущие модели готовы к автономной работе в DevOps-процессах. Бенчмарк фокусируется не на генерации синтаксически верного кода, а на способности агента выстраивать логическую цепочку рассуждений на основе технических артефактов, что является критическим этапом для автоматизации дежурств и сокращения времени восстановления сервисов (MTTR).

Ключевые факты

  • ORCA-bench имитирует работу дежурного инженера (oncall) с использованием реальных данных: метрик, логов, трассировок и исходного кода.
  • Основная задача агента — проведение анализа первопричин (Root Cause Analysis) на основе нечетких отчетов пользователей.
  • Бенчмарк проверяет способность моделей работать с зашумленными данными и восстанавливать хронологию инцидента спустя значительное время после его начала.
  • Инструмент направлен на оценку готовности general-purpose моделей к выполнению сложных инженерных задач в production-среде.