Разработчики представили инструмент для аудита ИИ-агентов, позволяющий выявлять потенциально опасные или необратимые действия в рамках заданных фреймворков. Исследование показало, что стандартные агентные системы часто обладают избыточными правами доступа, что создает критические уязвимости при выполнении цепочек задач. Инструмент помогает визуализировать и блокировать опасные вызовы API до их исполнения в реальной среде.

Проблема заключается в том, что современные агенты, обладающие доступом к инструментам (Tool Use), часто не имеют встроенных механизмов верификации последствий своих решений. В ходе тестирования выяснилось, что даже простые агенты могут непреднамеренно удалять данные, изменять конфигурации систем или совершать транзакции, если их контекст управления не ограничен жесткими правилами безопасности.

Данный подход к безопасности фокусируется на анализе графа действий агента. Вместо того чтобы полагаться исключительно на системные промпты, система проводит статический и динамический анализ цепочки вызовов. Это позволяет разработчикам внедрять «песочницы» для агентных операций, где каждое действие проходит проверку на соответствие политике безопасности перед отправкой на исполнение.

Ключевые факты

  • Инструмент выявляет «деструктивные» вызовы API, которые могут привести к потере данных или несанкционированным изменениям в инфраструктуре.
  • Система использует анализ графа действий для оценки последствий (consequential actions) до того, как агент совершит запрос.
  • Основной фокус направлен на защиту от неконтролируемого выполнения команд в средах с доступом к внешним базам данных и облачным сервисам.
  • Решение позволяет интегрировать уровни подтверждения (human-in-the-loop) для операций, помеченных как высокорисковые.