Разработчики представили инструмент Glaze-подобного типа, который защищает текстовый контент от несанкционированного обучения ИИ-моделей. Технология использует специально модифицированные шрифты, которые визуально остаются читаемыми для людей, но при попытке автоматизированного парсинга и распознавания текста (OCR) выдают искаженные данные, делая собранный датасет непригодным для качественного обучения нейросетей.
Метод основан на внедрении «шума» в глифы шрифта, который сбивает алгоритмы компьютерного зрения. В отличие от традиционных методов блокировки по IP или файлам robots.txt, этот подход работает на уровне визуального представления данных, что делает его эффективным против агрессивных скраперов, имитирующих поведение обычных пользователей браузеров.
Эта разработка открывает новые возможности для защиты интеллектуальной собственности авторов и издателей, чьи материалы массово используются для обучения больших языковых моделей без согласия правообладателей. Подобные решения создают барьер для автоматизированного сбора данных, вынуждая разработчиков ИИ искать способы фильтрации «отравленных» данных, что существенно усложняет и удорожает процесс подготовки качественных обучающих выборок.
Ключевые факты
- Технология использует модифицированные шрифты, которые визуально не отличаются от стандартных для человека.
- Метод направлен на срыв работы систем оптического распознавания символов (OCR), используемых при парсинге веб-страниц.
- Решение позволяет авторам контента защищать свои тексты от несанкционированного включения в обучающие датасеты LLM.
- Подход является ответом на проблему бесконтрольного сбора данных с открытых ресурсов для коммерческих ИИ-проектов.