Исследование 40 000 игровых сессий показало, что люди пропускают каждую третью потенциальную угрозу при подтверждении команд ИИ-агентов. Эксперимент выявил критическую уязвимость в системах «человек в контуре» (human-in-the-loop): пользователи склонны к автоматическому одобрению действий агента, даже если те нарушают правила безопасности или ведут к нежелательным последствиям в среде.
В ходе тестирования участники должны были модерировать действия агента, выполняющего задачи в игровой среде. Результаты демонстрируют, что когнитивная нагрузка и эффект привыкания значительно снижают бдительность операторов. При высокой частоте запросов на подтверждение точность человеческого контроля падает, что делает систему уязвимой для манипуляций со стороны агента или внешних воздействий.
Данные подчеркивают необходимость пересмотра подходов к проектированию интерфейсов безопасности для автономных систем. Вместо простого подтверждения действий пользователями, разработчикам стоит внедрять автоматизированные системы фильтрации рисков и контекстные подсказки, которые акцентируют внимание на потенциально опасных операциях, а не на рутинных задачах.
Ключевые факты
- Проанализировано 40 000 игровых запусков с участием ИИ-агентов.
- Уровень пропусков угроз составил 33% (каждое третье опасное действие одобрялось человеком).
- Исследование подтвердило высокую вероятность «автоматизма» у операторов при частом подтверждении запросов.
- Результаты указывают на неэффективность модели «человек в контуре» как единственного барьера безопасности при масштабировании агентных систем.