Mozilla.ai представила результаты комплексного тестирования инструментов безопасности (guardrails) для ИИ-агентов. Исследование оценивает способность открытых решений предотвращать вредоносные действия, такие как инъекции промптов и несанкционированный доступ к данным. Анализ показывает, что существующие методы защиты часто уязвимы перед сложными атаками, что требует пересмотра подходов к обеспечению безопасности в агентных системах.

Разработчики протестировали ряд популярных фреймворков, предназначенных для фильтрации входящих запросов и исходящих ответов агентов. Основная проблема заключается в том, что агенты, обладающие доступом к внешним инструментам и API, создают новые векторы атак, которые не учитываются стандартными методами защиты для обычных чат-ботов. Исследователи подчеркивают, что полагаться исключительно на встроенные фильтры моделей недостаточно для обеспечения надежной среды исполнения.

В ходе работы были выявлены критические пробелы в текущих реализациях систем защиты. Многие инструменты демонстрируют высокий уровень ложноположительных срабатываний, блокируя легитимные действия, при этом пропуская изощренные попытки обхода ограничений. Авторы призывают к созданию более динамичных систем мониторинга, которые анализируют не только текст, но и контекст выполнения агентных задач.

Ключевые факты

  • Исследование сфокусировано на оценке устойчивости систем защиты к атакам типа «инъекция промпта» и «несанкционированное выполнение кода».
  • Протестированы основные открытые инструменты, используемые для фильтрации контента в агентных архитектурах.
  • Выявлено, что текущие guardrails часто не справляются с многошаговыми агентными сценариями, где злоумышленник может манипулировать цепочкой рассуждений модели.
  • Результаты подчеркивают необходимость внедрения многоуровневой защиты, сочетающей статические правила и динамический анализ поведения агента в реальном времени.