Исследователи обнаружили, что добавление к запросу постороннего «отвлекающего» изображения (decoy image) значительно снижает эффективность атак на мультимодальные модели (VLM). Этот метод усиливает существующие защитные механизмы, заставляя модель игнорировать вредоносные инструкции, закодированные в тексте. Эффект наблюдается даже при использовании простых изображений, не связанных с контекстом атаки, что открывает новый вектор повышения безопасности систем.
В ходе экспериментов проверялась устойчивость пяти передовых мультимодальных моделей к двум типам закодированных атак. Выяснилось, что текущие системы защиты, работающие в режиме «черного ящика», демонстрируют уязвимости, которые можно закрыть на уровне предобработки входных данных. Добавление нейтрального визуального контента меняет способ обработки промпта моделью, затрудняя выполнение вредоносных команд.
Данный подход не требует дообучения моделей или изменения их архитектуры, что делает его перспективным инструментом для быстрой интеграции в существующие пайплайны безопасности. Метод демонстрирует, как взаимодействие между визуальным и текстовым каналами восприятия может быть использовано для фильтрации нежелательного контента, даже если сам текст атаки остается неизменным.
Ключевые факты
- Исследование охватило пять передовых мультимодальных моделей (VLM) и три типа систем защиты «черного ящика».
- Использование отвлекающих изображений (decoy images) приводит к резкому снижению показателя успешности атаки (ASR).
- Эффект достигается за счет изменения логики обработки входных данных в защитном контуре, а не за счет модификации самих изображений.
- Метод эффективен против двух семейств закодированных джейлбрейк-атак, направленных на обход текстовых фильтров безопасности.