Исследователи представили новый тип уязвимости для многошаговых RAG-агентов, получивший название «индукция значимости» (Salience Induction). Метод позволяет злоумышленникам манипулировать процессом извлечения данных, заставляя модель игнорировать релевантные документы в пользу вредоносного контента. Это ставит под угрозу надежность систем, полагающихся на поиск информации в больших базах данных для формирования ответов.

Атака эксплуатирует механизм ранжирования, который используют современные RAG-конвейеры. Внедряя в документы специфические маркеры или структуру, атакующий повышает «вес» вредоносной информации, делая её приоритетной для агента. В результате система выдает искаженные ответы, даже если в базе присутствуют достоверные источники. Это критическая проблема для корпоративных решений, где точность поиска напрямую влияет на принятие решений.

Для противодействия авторы предлагают методы защиты, основанные на проверке целостности контекста и использовании более устойчивых алгоритмов ранжирования. Исследование подчеркивает, что стандартные методы фильтрации промптов становятся недостаточными, так как атака происходит на этапе подготовки данных, а не через прямой ввод пользователя.

Ключевые факты

  • Метод Salience Induction позволяет манипулировать ранжированием документов в многошаговых RAG-системах.
  • Атака направлена на искажение процесса выбора контекста, а не на прямое внедрение инструкций (prompt injection).
  • Исследование демонстрирует снижение точности ответов агентов при воздействии на механизмы извлечения данных.
  • Предложенные защитные стратегии включают методы верификации источников и повышение устойчивости алгоритмов ранжирования к манипулятивным маркерам.