Разработчики ИИ-систем начали массово скупать подержанные книги, чтобы использовать их тексты для обучения больших языковых моделей. После оцифровки бумажные экземпляры физически уничтожаются. Этот подход позволяет компаниям обходить ограничения авторского права и получать доступ к качественным, структурированным данным, которые зачастую отсутствуют в открытом доступе в цифровом виде.
Процесс включает поиск редких изданий, их сканирование и последующую утилизацию, что вызывает обеспокоенность у библиотек и букинистических магазинов. Подобная практика подчеркивает критический дефицит высококачественных текстовых данных для обучения моделей. В то время как интернет-контент становится всё более зашумленным или закрытым через paywall, физические архивы превращаются в стратегический ресурс для разработчиков ИИ.
Такая стратегия сбора данных создает новые юридические и этические вызовы. Владельцы авторских прав и издатели сталкиваются с тем, что их интеллектуальная собственность изымается из оборота и поглощается алгоритмами без явного согласия или компенсации. Это ставит под вопрос устойчивость текущих методов формирования обучающих выборок и может привести к ужесточению контроля над доступом к печатным материалам.
Ключевые факты
- ИИ-компании скупают тысячи подержанных книг для формирования специализированных датасетов.
- После сканирования физические копии книг уничтожаются, что исключает их повторное попадание на рынок.
- Основная цель процесса — получение доступа к качественным текстам, которые не были оцифрованы или защищены авторскими правами в цифровой среде.
- Практика вызывает конфликт между разработчиками ИИ и индустрией книгоиздания из-за использования интеллектуальной собственности без лицензирования.