Исследователи представили метод SHE (Trajectory-driven Safety Harness Evolution), который переосмысливает безопасность ИИ-агентов. Вместо статичных защитных механизмов система использует анализ траекторий выполнения задач для динамической адаптации «обвязки» (harness) агента. Это позволяет гибко управлять контекстом, памятью и правами доступа, предотвращая риски, возникающие в процессе взаимодействия модели с внешними инструментами и средой исполнения.

Традиционные методы обеспечения безопасности часто рассматривают инфраструктуру агента как неизменный артефакт, что делает их уязвимыми перед новыми типами угроз. В рамках подхода SHE компоненты управления памятью, доступом к инструментам и контекстным окном становятся адаптивными. Система анализирует историю действий агента и автоматически корректирует политики безопасности, минимизируя вероятность несанкционированного использования функций или утечки данных в процессе работы.

Метод фокусируется на разделении функций внутри агентной архитектуры, что позволяет изолировать критические узлы управления. Благодаря этому разработчики могут внедрять обновления безопасности без переобучения базовой модели, просто модифицируя логику «обвязки». Такой подход повышает устойчивость агентов к сложным сценариям эксплуатации, где злоумышленники пытаются манипулировать последовательностью вызовов инструментов или состоянием памяти системы.

Ключевые факты

  • Метод SHE переводит безопасность агентов из статического состояния в динамический процесс эволюции на основе анализа траекторий.
  • Система позволяет адаптировать политики доступа и управления памятью без необходимости изменения весов базовой LLM.
  • Архитектурное решение направлено на устранение проблем, связанных с тесной связностью компонентов в текущих агентных фреймворках.
  • Подход повышает защиту от атак, использующих манипуляцию контекстом и последовательностью вызовов внешних инструментов.