Исследователи предложили математическую модель для эффективного аудита флота из N ИИ-агентов при жестком ограничении ресурсов, когда человек может проверить лишь малую часть результатов. Работа определяет критический порог калибровки уверенности моделей, после которого доверие к самооценке агентов становится контрпродуктивным и уступает случайной выборке для контроля качества.

В условиях, когда агенты склонны к коррелированным ошибкам, а их отчеты об уверенности могут быть преднамеренно искажены, стандартные методы ранжирования проверок теряют эффективность. Авторы используют аппарат гауссовских копул для моделирования зависимостей между ошибками агентов. Это позволяет выявить пороговое значение δ*, при превышении которого использование оценок уверенности агентов для приоритизации аудита приносит больше вреда, чем пользы.

Исследование подчеркивает риски слепого доверия к внутренним метрикам уверенности LLM при масштабировании агентных систем. Предложенный подход помогает разработчикам выстраивать более надежные стратегии контроля качества, минимизируя вероятность пропуска критических сбоев в условиях ограниченного человеческого участия в процессе верификации.

Ключевые факты

  • Модель рассматривает сценарий аудита N агентов при бюджете проверок B, где B значительно меньше N.
  • Введен порог калибровки δ*, определяющий границу эффективности использования самооценки агентов.
  • Использован математический аппарат двухуровневых гауссовских копул для учета корреляции ошибок внутри флота агентов.
  • Доказано, что при сильной мискалибровке случайный аудит превосходит методы, основанные на ранжировании по уверенности моделей.