Исследователи представили OpenStamp — метод внедрения невидимых водяных знаков в ответы LLM с открытыми весами. Технология позволяет верифицировать авторство текста, сохраняя при этом высокое качество генерации и устойчивость к попыткам удаления меток. Решение направлено на решение проблемы идентификации контента, созданного моделями, которые не контролируются централизованно через API, что критично для безопасности и борьбы с дезинформацией.
Традиционные методы маркировки часто требуют доступа к логитам модели или специфическим настройкам инференса, что затруднительно для локально запускаемых моделей. OpenStamp использует подход, основанный на встраивании статистических сигналов непосредственно в процесс генерации, что делает водяной знак трудноуловимым для пользователей, но доступным для проверки алгоритмами детекции.
Разработка помогает владельцам моделей отслеживать использование своих интеллектуальных активов и снижать риски, связанные с неконтролируемым распространением сгенерированного контента. Метод демонстрирует эффективность в условиях, когда злоумышленники пытаются перефразировать или исказить текст для обхода систем защиты.
Ключевые факты
- OpenStamp разработан для моделей с открытыми весами, где отсутствует централизованный контроль над инференсом.
- Метод обеспечивает высокую точность детекции при минимальном влиянии на перплексию и качество ответов модели.
- Технология устойчива к атакам типа «перефразирование», которые обычно разрушают классические статистические водяные знаки.
- Решение доступно в виде открытого репозитория для интеграции в пайплайны генерации текста.