Исследователи проанализировали риски безопасности при использовании «персональных навыков» (persona skills) — артефактов, созданных на основе истории взаимодействия пользователя с ИИ. Такие системы концентрируют фрагментированные личные данные, что создает угрозы утечки конфиденциальной информации и облегчает создание глубоких имитаций личности (impersonation), обходя традиционные методы защиты, ориентированные на отдельные записи или стандартный RAG.

Процесс создания персонализированных агентов предполагает извлечение и сжатие пользовательских данных в переносимые форматы. Это упрощает перенос контекста между различными агентными средами, но одновременно превращает разрозненные сигналы в единый профиль, который может быть скомпрометирован. Авторы работы подчеркивают, что существующие механизмы защиты, такие как фильтрация запросов или ограничение доступа к базе знаний, оказываются недостаточно эффективными против атак, направленных на извлечение «личности» из таких сжатых артефактов.

В рамках исследования был представлен бенчмарк для оценки уязвимостей, позволяющий измерять вероятность утечки приватных данных и успешность атак по имитации поведения пользователя. Работа предлагает новые подходы к защите, включая методы дифференциальной приватности при обучении навыков и механизмы контроля доступа, которые учитывают специфику агентных архитектур, где данные не просто хранятся, а активно используются для генерации ответов.

Ключевые факты

  • Исследование сфокусировано на рисках «персональных навыков» (persona skills), которые агрегируют историю взаимодействий пользователя.
  • Основные угрозы включают утечку личных данных и возможность создания высокоточных имитаций личности агентом.
  • Традиционные методы защиты (RAG-фильтрация, контроль доступа к записям) не справляются с защитой сжатых агентных артефактов.
  • Предложен новый бенчмарк для количественной оценки рисков приватности и эффективности методов защиты в агентных системах.
  • Работа подчеркивает необходимость внедрения дифференциальной приватности при создании персонализированных моделей поведения агентов.