Исследователи изучили устойчивость технологии SynthID от Google DeepMind, предназначенной для обнаружения ИИ-контента через скрытые водяные знаки. В ходе работы удалось успешно реализовать атаку по извлечению модели, восстановив функциональность детектора, а также применить состязательные методы для обхода защиты. Результаты показывают, что текущие механизмы верификации генеративных изображений остаются уязвимыми к целенаправленным манипуляциям.

SynthID внедряет невидимые изменения в пиксели изображений, созданных нейросетями, что позволяет Google идентифицировать их как синтетические. В рамках эксперимента авторы использовали методы обучения суррогатной модели на основе ответов API детектора. Это позволило создать локальную копию системы, которая с высокой точностью предсказывает вердикт оригинального инструмента, не имея прямого доступа к его весам.

Помимо извлечения, исследование демонстрирует эффективность состязательных атак (adversarial attacks). Добавление специфического шума в изображение позволяет «обмануть» детектор, заставляя его классифицировать синтетический контент как созданный человеком, при этом визуальное качество картинки практически не страдает. Эти данные ставят под сомнение надежность водяных знаков как единственного метода подтверждения подлинности медиафайлов в условиях активного противодействия.

Ключевые факты

  • Исследование сфокусировано на SynthID — проприетарной технологии Google DeepMind для маркировки ИИ-изображений.
  • Успешно реализована атака по извлечению модели (model extraction), позволившая воссоздать логику работы детектора.
  • Применены состязательные атаки, которые позволяют модифицировать изображение так, чтобы детектор перестал распознавать в нем водяной знак.
  • Работа подтверждает, что скрытые водяные знаки уязвимы к методам машинного обучения, направленным на их обход или имитацию.
  • Результаты подчеркивают необходимость многоуровневых систем проверки контента, а не опоры на один тип детекторов.