Исследователи выяснили, что внутренние механизмы оценки вредоносности промптов часто не справляются с выявлением успешных джейлбрейков. Текущие системы безопасности анализируют намерение пользователя до генерации ответа, однако успех атаки зависит от взаимодействия конкретной модели, стратегии декодирования и внешних факторов. В результате многие опасные запросы проходят фильтрацию, так как метрики безопасности не учитывают итоговый результат генерации.
Проблема заключается в фундаментальном разрыве между оценкой «вредного намерения» и фактическим поведением модели. Авторы работы подчеркивают, что существующие скоринговые системы, используемые для предварительной фильтрации, часто демонстрируют обратную корреляцию с реальной устойчивостью моделей к обходу ограничений. Это означает, что разработчики полагаются на метрики, которые не способны предсказать, приведет ли конкретный промпт к генерации запрещенного контента.
Для повышения безопасности предлагается сместить фокус с анализа входных данных на оценку динамических процессов генерации. Текущие методы «превентивной защиты» создают ложное чувство безопасности, игнорируя тот факт, что джейлбрейк — это результат сложной цепочки событий, а не просто наличие «плохих» слов или намерений в запросе пользователя.
Ключевые факты
- Внутренние системы безопасности оценивают промпт до начала генерации, что делает их нечувствительными к контекстуальным особенностям целевой модели.
- Существует отрицательная корреляция между внутренними оценками вредоносности и реальной частотой успешных джейлбрейков.
- Успех атаки определяется совокупностью факторов: архитектурой модели, параметрами декодирования и используемыми методами оценки (judge).
- Исследование доказывает, что текущие бенчмарки безопасности, основанные на статичном анализе промптов, не отражают реальную защищенность систем.