Исследователи проанализировали распространение вредоносных навыков для автономных ИИ-агентов в открытых репозиториях. Работа демонстрирует, как злоумышленники адаптируют агентные фреймворки для выполнения несанкционированных действий, таких как кража данных или обход систем аутентификации. Авторы подчеркивают, что текущие механизмы безопасности не успевают за темпами интеграции сторонних плагинов и инструментов в агентные системы.
В ходе работы был проведен аудит популярных библиотек и маркетплейсов, где размещаются расширения для популярных агентных платформ. Выяснилось, что многие инструменты содержат скрытые функции, позволяющие агенту выходить за рамки заданных полномочий (sandbox escape) или манипулировать системными вызовами. Это создает серьезные риски для корпоративных сред, где агенты получают доступ к внутренним API и базам данных.
Авторы предлагают классификацию векторов атак, специфичных для агентной архитектуры, включая «отравление» памяти агента и манипуляцию цепочками рассуждений (Chain-of-Thought). Исследование акцентирует внимание на необходимости внедрения строгих политик валидации кода и динамического мониторинга поведения агентов в реальном времени, чтобы предотвратить выполнение вредоносных команд в автоматизированных рабочих процессах.
Ключевые факты
- Исследование охватило более 500 публичных репозиториев с плагинами и навыками для популярных агентных фреймворков.
- Выявлено 12 типов критических уязвимостей, позволяющих агентам выполнять несанкционированные операции в файловой системе и сети.
- Установлено, что среднее время от публикации вредоносного навыка до его интеграции в пользовательские проекты составляет менее 48 часов.
- Предложен новый метод «песочницы» для исполнения агентных навыков, который снижает риск утечки данных на 70% в тестовых сценариях.