Новое эмпирическое исследование показало, что существующие методы маркировки контента, созданного нейросетями, уязвимы перед простыми атаками. Авторы работы протестировали популярные алгоритмы водяных знаков и выяснили, что их можно легко удалить или исказить, сохранив при этом качество генерации. Это ставит под сомнение эффективность текущих решений для верификации ИИ-контента в реальных условиях.
Исследователи проанализировали устойчивость методов внедрения скрытых сигналов в текстовые и графические модели. Оказалось, что даже незначительные модификации выходных данных, такие как перефразирование текста или изменение параметров сжатия изображений, делают водяные знаки нечитаемыми для детекторов. В результате системы, предназначенные для борьбы с дипфейками и автоматизированным контентом, демонстрируют крайне низкую точность при попытках идентификации.
Проблема заключается в фундаментальном конфликте между незаметностью водяного знака и его защищенностью. Текущие подходы либо слишком легко удаляются при пост-обработке, либо вносят заметные искажения в результат работы модели. Авторы подчеркивают, что для создания надежной системы защиты требуется переход к более сложным криптографическим методам, которые интегрируются непосредственно в процесс обучения и инференса моделей, а не накладываются поверх них.
Ключевые факты
- Исследование охватило широкий спектр алгоритмов водяных знаков, используемых в современных генеративных моделях.
- Установлено, что методы удаления водяных знаков, такие как перефразирование или изменение параметров сжатия, снижают эффективность детекторов до статистически незначимых уровней.
- Авторы доказали, что текущие системы маркировки не соответствуют стандартам «криминалистической готовности» для использования в юридических или регуляторных целях.
- Работа подчеркивает необходимость разработки новых стандартов верификации, устойчивых к злонамеренным манипуляциям и случайным искажениям данных.