Исследователи представили новый тип уязвимости для многошаговых RAG-агентов, получивший название «индукция значимости» (Salience Induction). Метод позволяет злоумышленникам манипулировать процессом извлечения данных, заставляя модель игнорировать релевантные документы в пользу вредоносного контента. Это ставит под угрозу надежность систем, полагающихся на поиск информации в больших базах данных для формирования ответов.
Атака эксплуатирует механизм ранжирования, который используют современные RAG-конвейеры. Внедряя в документы специфические маркеры или структуру, атакующий повышает «вес» вредоносной информации, делая её приоритетной для агента. В результате система выдает искаженные ответы, даже если в базе присутствуют достоверные источники. Это критическая проблема для корпоративных решений, где точность поиска напрямую влияет на принятие решений.
Для противодействия авторы предлагают методы защиты, основанные на проверке целостности контекста и использовании более устойчивых алгоритмов ранжирования. Исследование подчеркивает, что стандартные методы фильтрации промптов становятся недостаточными, так как атака происходит на этапе подготовки данных, а не через прямой ввод пользователя.
Ключевые факты
- Метод Salience Induction позволяет манипулировать ранжированием документов в многошаговых RAG-системах.
- Атака направлена на искажение процесса выбора контекста, а не на прямое внедрение инструкций (prompt injection).
- Исследование демонстрирует снижение точности ответов агентов при воздействии на механизмы извлечения данных.
- Предложенные защитные стратегии включают методы верификации источников и повышение устойчивости алгоритмов ранжирования к манипулятивным маркерам.