Исследователи проанализировали уязвимости в современных ИИ-агентах для написания кода, способных исполнять внешние файлы навыков. Работа демонстрирует, как злоумышленники могут внедрять вредоносные инструкции, которые обходят стандартные фильтры безопасности. Авторы предлагают методологию оценки рисков, позволяющую выявлять опасные паттерны в агентных системах до их интеграции в рабочие процессы разработки программного обеспечения.

Современные кодинг-агенты всё чаще получают доступ к расширяемым библиотекам функций, что создает вектор атаки через «инъекции навыков». В отличие от классических промпт-инъекций, этот метод эксплуатирует логику исполнения кода, когда агент доверяет внешним файлам с описанием функций. Исследование показывает, что даже при наличии базовых проверок безопасности, агенты могут быть принуждены к выполнению несанкционированных действий, таких как кража данных или модификация системных файлов.

Для минимизации угроз авторы статьи вводят систему классификации вредоносных навыков и предлагают фреймворк для тестирования агентов на устойчивость к подобным манипуляциям. Это критически важно для компаний, внедряющих автономные системы разработки, так как текущие методы защиты часто не учитывают специфику агентного взаимодействия с файловой системой и внешними API.

Ключевые факты

  • Исследование сфокусировано на уязвимостях в архитектуре кодинг-агентов, использующих модульные файлы навыков.
  • Выявлено, что текущие механизмы фильтрации не способны эффективно блокировать вредоносные инструкции, замаскированные под легитимные функции.
  • Предложенная методология оценки рисков включает классификацию векторов атак на основе степени автономности агента.
  • Работа подчеркивает необходимость внедрения песочниц (sandboxing) и строгой верификации кода для всех внешних плагинов, используемых в агентных средах.