Исследователи представили метод ColluSkill, демонстрирующий уязвимость систем безопасности ИИ-агентов. Текущие сканеры навыков анализируют функции изолированно, не учитывая риски их совместного использования. Метод позволяет обходить защиту, объединяя несколько безопасных по отдельности навыков в одну вредоносную цепочку, что создает критическую брешь в архитектуре защиты агентных систем и требует пересмотра подходов к их мониторингу.

Современные системы защиты ИИ-агентов фокусируются на проверке отдельных инструментов или функций, которые агент может вызывать. Однако злоумышленники могут использовать стратегию «составных навыков», где каждый шаг цепочки действий выглядит легитимным для сканера, но их совокупная последовательность приводит к выполнению несанкционированных операций. Это делает существующие методы фильтрации неэффективными против сложных многошаговых атак.

Авторы работы подчеркивают, что проблема заключается в отсутствии контекстного анализа взаимодействия между различными навыками в процессе исполнения. Для повышения безопасности разработчикам необходимо внедрять механизмы контроля, которые оценивают не только отдельные действия, но и общую логику поведения агента на протяжении всей сессии. Это критически важно для систем, имеющих доступ к внешним API и чувствительным данным.

Ключевые факты

  • ColluSkill эксплуатирует слепую зону в текущих сканерах, которые проверяют навыки по отдельности, а не в связке.
  • Метод доказывает, что комбинация нескольких «безопасных» навыков может привести к выполнению вредоносной последовательности действий.
  • Исследование указывает на необходимость перехода от статической проверки функций к динамическому анализу цепочек вызовов агента.
  • Работа подчеркивает критическую важность контекстной безопасности для агентных систем, взаимодействующих с внешними средами.