Исследователи PredictionGuard проанализировали инцидент с утечкой данных через агентскую систему, использующую Hugging Face. В ходе эксперимента удалось скомпрометировать ИИ-агента, заставив его раскрыть скрытые инструкции и «ключи ответов» из контекста. Этот случай демонстрирует критические риски при интеграции LLM с внешними инструментами и базами знаний, подчеркивая необходимость усиления механизмов защиты промптов.
Инцидент произошел в рамках тестирования безопасности агентских систем, где модель имела доступ к специфическим данным через RAG-пайплайн. Злоумышленники использовали методы инъекции, чтобы обойти системные ограничения и извлечь конфиденциальную информацию, которая не предназначалась для пользователя. Исследование показывает, что даже при наличии базовых фильтров, агенты остаются уязвимыми, если они не изолированы от доступа к чувствительным системным метаданным.
Основная проблема заключается в том, что современные агенты часто смешивают пользовательский ввод с внутренними инструкциями и данными из внешних источников в одном контекстном окне. Это позволяет манипулировать поведением модели, заставляя её игнорировать правила безопасности. Для предотвращения подобных атак разработчикам рекомендуется внедрять строгую валидацию входных данных и использовать архитектуры с разделением уровней доступа к информации.
Ключевые факты
- Инцидент связан с эксплуатацией уязвимости в агентской системе, использующей инфраструктуру Hugging Face.
- Атака позволила извлечь «ключи ответов» (answer keys), которые хранились в защищенной области данных.
- Исследование подтверждает, что текущие методы RAG-интеграции могут приводить к непреднамеренному раскрытию системных промптов.
- Специалисты PredictionGuard подчеркивают необходимость внедрения многоуровневой фильтрации запросов для защиты агентских сред.