Исследователи представили новый метод детектирования вредоносного контента, созданного с помощью LoRA-адаптеров для генеративных моделей. Технология анализирует веса дообученных слоев, позволяя выявлять специфические паттерны, связанные с генерацией запрещенных изображений, даже если сами обучающие данные недоступны. Это решение повышает безопасность открытых платформ, позволяя фильтровать опасные дополнения до их активации в инференсе.
Проблема безопасности генеративных моделей часто упирается в легкость распространения LoRA-файлов, которые позволяют модифицировать поведение базовых моделей без их полного переобучения. Традиционные методы фильтрации контента на уровне промптов или выходных изображений оказываются недостаточно эффективными против целенаправленных атак, использующих специфические стили или объекты, заложенные в веса адаптера.
Предложенный подход фокусируется на анализе структуры весов, что позволяет классифицировать адаптеры по их потенциальному содержимому. Метод демонстрирует высокую точность в идентификации вредоносных LoRA, что дает возможность автоматизировать модерацию пользовательского контента на хостингах моделей и в распределенных системах генерации, снижая риски распространения нежелательных материалов.
Ключевые факты
- Метод позволяет детектировать вредоносный контент путем анализа весов LoRA-адаптеров без необходимости доступа к исходному набору данных.
- Технология направлена на предотвращение генерации запрещенных изображений, которые обходят стандартные фильтры безопасности моделей.
- Подход применим для автоматизированной модерации на платформах, распространяющих пользовательские дополнения для нейросетей.
- Исследование предлагает способ защиты экосистемы открытых моделей от злоупотреблений через легковесные методы дообучения.