Исследователи выяснили, что внутренние механизмы оценки вредоносности промптов часто не справляются с выявлением успешных джейлбрейков. Текущие системы безопасности анализируют намерение пользователя до генерации ответа, однако успех атаки зависит от взаимодействия конкретной модели, стратегии декодирования и внешних факторов. В результате многие опасные запросы проходят фильтрацию, так как метрики безопасности не учитывают итоговый результат генерации.

Проблема заключается в фундаментальном разрыве между оценкой «вредного намерения» и фактическим поведением модели. Авторы работы подчеркивают, что существующие скоринговые системы, используемые для предварительной фильтрации, часто демонстрируют обратную корреляцию с реальной устойчивостью моделей к обходу ограничений. Это означает, что разработчики полагаются на метрики, которые не способны предсказать, приведет ли конкретный промпт к генерации запрещенного контента.

Для повышения безопасности предлагается сместить фокус с анализа входных данных на оценку динамических процессов генерации. Текущие методы «превентивной защиты» создают ложное чувство безопасности, игнорируя тот факт, что джейлбрейк — это результат сложной цепочки событий, а не просто наличие «плохих» слов или намерений в запросе пользователя.

Ключевые факты

  • Внутренние системы безопасности оценивают промпт до начала генерации, что делает их нечувствительными к контекстуальным особенностям целевой модели.
  • Существует отрицательная корреляция между внутренними оценками вредоносности и реальной частотой успешных джейлбрейков.
  • Успех атаки определяется совокупностью факторов: архитектурой модели, параметрами декодирования и используемыми методами оценки (judge).
  • Исследование доказывает, что текущие бенчмарки безопасности, основанные на статичном анализе промптов, не отражают реальную защищенность систем.