Крупные ИИ-разработчики прибегают к уничтожению миллионов физических книг после их использования для обучения нейросетей. Процесс организован через посредников, которые скупают печатные издания, оцифровывают их для датасетов, а затем отправляют в шредеры. Эта практика направлена на минимизацию юридических рисков, связанных с хранением и распространением защищенного авторским правом контента, который стал основой для современных больших языковых моделей.
Использование книг в качестве обучающих данных стало стандартом индустрии, однако правовой статус таких датасетов остается предметом острых дискуссий. Компании стремятся скрыть цепочки поставок данных, чтобы избежать претензий со стороны издательств и авторов. Уничтожение физических носителей после сканирования — это способ формально избавиться от доказательств владения материалами, которые могли быть получены без соответствующих лицензий или согласий правообладателей.
Подобные методы вызывают серьезные вопросы к прозрачности формирования обучающих выборок. В то время как разработчики заявляют о необходимости огромных массивов качественных текстов для повышения точности моделей, издательское сообщество указывает на нарушение интеллектуальных прав. Ситуация подчеркивает растущий разрыв между темпами развития технологий и существующими нормами авторского права в эпоху генеративного ИИ.
Ключевые факты
- Компании используют посредников для скрытной скупки книг, чтобы избежать прямой связи с разработчиками ИИ.
- Физические копии книг уничтожаются сразу после завершения процесса оцифровки для обучения нейросетей.
- Основная цель уничтожения материалов — снижение юридических рисков и затруднение доказательства факта использования защищенного контента.
- Оцифрованные данные из книг являются критически важным ресурсом для обучения LLM, обеспечивая высокое качество языковых моделей.