Исследователи представили алгоритм внедрения статистических водяных знаков в выходные данные больших языковых моделей. Метод позволяет с высокой точностью определять, был ли текст сгенерирован ИИ, не влияя при этом на качество и связность ответов. Технология основана на модификации процесса выбора токенов во время инференса, что делает детектирование возможным даже при ограниченном объеме текста.

Основная идея заключается в разделении словаря токенов на две группы — «зеленые» и «красные» списки — на основе хеш-функции от предыдущего контекста. В процессе генерации модель отдает предпочтение токенам из «зеленого» списка. При проверке текста алгоритм анализирует частоту появления токенов из этих списков: если их распределение статистически значимо отклоняется от случайного в пользу «зеленых», система с высокой вероятностью классифицирует контент как машинный.

Такой подход решает проблему верификации контента без необходимости хранения огромных баз данных с оригинальными текстами. В отличие от методов, требующих дообучения моделей или использования внешних классификаторов, данный алгоритм интегрируется непосредственно в процесс генерации. Это обеспечивает устойчивость к попыткам обхода защиты через перефразирование, так как статистический след сохраняется даже при частичном изменении структуры предложений.

Ключевые факты

  • Метод использует хеширование предыдущего токена для динамического определения разрешенных списков слов в процессе генерации.
  • Статистический тест позволяет обнаружить водяной знак даже в коротких фрагментах текста, где другие методы детектирования показывают низкую эффективность.
  • Технология не требует изменения архитектуры модели или дополнительного обучения, работая на этапе декодирования.
  • Алгоритм демонстрирует высокую устойчивость к атакам, основанным на замене слов или перефразировании сгенерированного контента.