Исследователи представили MemSecBench — первый комплексный бенчмарк для оценки уязвимостей долгосрочной памяти ИИ-агентов. Инструмент отслеживает жизненный цикл вредоносных инструкций: от момента их записи в базу данных до активации в ходе выполнения задач. Работа демонстрирует, как злоумышленники могут внедрять скрытые команды, которые долгое время остаются неактивными, а затем влияют на критические решения агента.

Системы памяти позволяют агентам сохранять контекст прошлых взаимодействий, однако это создает вектор атаки, при котором вредоносный контент становится «персистентным». В отличие от стандартных тестов на безопасность, MemSecBench фокусируется на семантической целостности данных. Он анализирует, как именно агент интерпретирует накопленный опыт и способен ли он отличить легитимные инструкции от инъекций, направленных на подмену целей.

Бенчмарк также оценивает эффективность механизмов очистки памяти и восстановления системы после обнаружения атаки. Это критически важно для разработки надежных агентных архитектур, где долгосрочная память является ключевым компонентом для выполнения многоэтапных задач. Исследование подчеркивает необходимость внедрения строгих протоколов фильтрации данных на этапе их извлечения из векторных хранилищ.

Ключевые факты

  • MemSecBench отслеживает путь вредоносного кода от этапа записи в память до его исполнения.
  • Исследование выявляет риски «отложенного действия», когда инъекция активируется спустя значительное время после попадания в базу.
  • Бенчмарк включает метрики для оценки качества восстановления системы после успешной атаки на память.
  • Основной фокус сделан на семантическом анализе данных, которые агент использует для принятия решений в долгосрочной перспективе.