Разработчик представил проект HOM-AIMOS, демонстрирующий уязвимость систем памяти ИИ-агентов к атакам типа «отравление данных». В отличие от стандартных систем, которые стремятся очищать контекст, этот подход намеренно сохраняет вредоносные данные в долгосрочной памяти агента. Это позволяет изучить механизмы манипуляции поведением моделей через внедрение специфических паттернов в их базу знаний.
Проблема актуальна для архитектур, использующих RAG (Retrieval-Augmented Generation) и векторные базы данных для хранения опыта агентов. Если система не обладает надежными механизмами фильтрации или верификации входящей информации, злоумышленник может внедрить «закладки» в память агента. При последующем извлечении этих данных модель может начать выдавать нежелательные ответы или следовать инструкциям, заложенным в отравленном контенте, обходя стандартные системные промпты.
Исследование подчеркивает критическую важность безопасности при проектировании модулей памяти. Разработчики агентных систем часто фокусируются на эффективности поиска и релевантности контекста, однако целостность данных в базе памяти остается уязвимым вектором атаки. Проект предлагает экспериментальную базу для тестирования устойчивости RAG-пайплайнов к подобным инъекциям и анализа того, как долгосрочное хранение скомпрометированной информации влияет на принятие решений агентом.
Ключевые факты
- Проект HOM-AIMOS сфокусирован на изучении механизмов сохранения вредоносных данных в памяти агентов.
- Исследование демонстрирует, что отравленные данные могут оставаться в системе долгосрочно, влияя на будущие ответы модели.
- Основной вектор угрозы связан с RAG-системами, где агент доверяет извлеченной из базы информации как достоверному источнику.
- Работа подчеркивает необходимость внедрения методов валидации и очистки данных в агентных архитектурах с долгосрочной памятью.