Исследователи проанализировали механизмы безопасности в диффузионных больших языковых моделях (DLLM), которые используют итеративное шумоподавление вместо классического авторегрессионного предсказания токенов. Работа выявила критические уязвимости в методах алайнмента таких моделей: системы защиты оказались разреженными и подверженными атакам переноса, что ставит под сомнение надежность текущих подходов к безопасности в архитектурах нового типа.

В отличие от стандартных LLM, где безопасность часто строится на фильтрации вывода или специфическом дообучении, диффузионные модели обрабатывают данные параллельно. Авторы исследования продемонстрировали, что эти архитектуры могут выступать как в роли целей для взлома, так и в качестве инструментов для создания состязательных атак. Механистический анализ показал, что внутренние представления безопасности в DLLM не обладают достаточной устойчивостью к манипуляциям.

Полученные результаты подчеркивают необходимость пересмотра стратегий обеспечения безопасности при переходе от авторегрессионных моделей к диффузионным. Выявленные векторы атак позволяют обходить ограничения, заложенные разработчиками, используя специфику процесса шумоподавления для генерации нежелательного контента. Это исследование является важным шагом в понимании того, как фундаментальные различия в архитектуре нейросетей влияют на их защищенность от злоупотреблений.

Ключевые факты

  • Диффузионные LLM используют итеративное параллельное шумоподавление вместо последовательного предсказания токенов.
  • Механизмы безопасности в DLLM признаны разреженными и уязвимыми для атак переноса (transferable attacks).
  • Исследование подтверждает, что диффузионные модели могут эффективно использоваться как для генерации вредоносных запросов, так и в качестве объектов для состязательного воздействия.
  • Выявленные уязвимости указывают на необходимость разработки новых методов алайнмента, адаптированных под специфику диффузионных процессов.