Исследователи формализовали новый класс уязвимостей под названием «Self-State Attacks», направленный на ИИ-агентов с долгосрочной памятью. Атака заключается в манипуляции внутренним состоянием агента через внедрение вредоносных данных в его базу знаний или историю взаимодействий. Это позволяет злоумышленникам скрыто изменять поведение системы, заставляя её совершать несанкционированные действия или игнорировать заданные инструкции безопасности.

Проблема актуальна для всех систем, использующих RAG (Retrieval-Augmented Generation) и внешние хранилища для контекста. В отличие от классических атак на промпты, Self-State Attacks действуют на уровне «самосознания» агента, подменяя его представления о собственных целях или прошлых событиях. Поскольку агент доверяет данным, извлеченным из собственной памяти, он воспринимает отравленную информацию как легитимный опыт, что делает такие атаки крайне сложными для обнаружения стандартными фильтрами ввода.

Авторы исследования подчеркивают, что архитектурная особенность современных агентов — постоянное обновление контекста — становится вектором атаки. Если злоумышленник получает доступ к записи в векторную базу данных или лог-файлы агента, он может постепенно «перепрограммировать» модель, внедряя ложные факты, которые со временем становятся частью её операционной логики. Это создает долгосрочные риски для автономных систем, работающих в критических бизнес-процессах.

Ключевые факты

  • Self-State Attacks эксплуатируют доверие агента к данным, хранящимся во внешней памяти (RAG).
  • Метод позволяет злоумышленникам скрыто менять цели и логику принятия решений без прямого вмешательства в системный промпт.
  • Уязвимость особенно критична для автономных агентов, которые полагаются на накопленный опыт для выполнения многошаговых задач.
  • Исследование формализует механизмы отравления памяти как новый вектор атак на цепочки поставок данных в ИИ-системах.