Исследователи представили ARB (Authorship-Rewriting Benchmark) — новый набор данных для оценки эффективности детекторов ИИ-контента. В отличие от стандартных тестов, сравнивающих чистый человеческий текст с генерацией LLM, ARB фокусируется на случаях, когда ИИ перефразирует или переписывает авторский текст человека. Это позволяет точнее оценить устойчивость детекторов к методам обхода защиты через рерайтинг.
Существующие инструменты обнаружения ИИ-текста часто показывают высокую точность на синтетических данных, но теряют эффективность при столкновении с гибридным контентом. Авторы работы подчеркивают, что простое сравнение «человек против машины» не отражает реальные сценарии использования, где пользователи применяют LLM для стилистической правки или сокращения собственных черновиков. Новый бенчмарк помогает выявить уязвимости алгоритмов, которые ошибочно классифицируют отредактированный человеком текст как полностью сгенерированный или наоборот.
Использование ARB позволяет разработчикам систем безопасности и модерации контента лучше понимать границы применимости своих решений. Исследование демонстрирует, что способность моделей к перефразированию существенно снижает надежность классификаторов, обученных на классических датасетах. Это создает необходимость в обновлении методов обучения детекторов, чтобы они могли учитывать контекст авторства и специфические паттерны, возникающие при итеративном редактировании текста с помощью нейросетей.
Ключевые факты
- ARB (Authorship-Rewriting Benchmark) специально разработан для проверки детекторов на текстах, прошедших через LLM-рерайтинг.
- Исследование подтверждает, что традиционные бенчмарки переоценивают реальную точность детекторов в условиях реального использования.
- Основная проблема существующих систем заключается в неспособности эффективно различать авторский стиль после глубокой стилистической обработки нейросетью.
- Бенчмарк направлен на закрытие пробела в оценке моделей, которые сталкиваются с гибридным контентом, созданным в связке «человек + ИИ».