Разработчики ИИ-моделей активно скупают редкие и вышедшие из тиража книги, чтобы использовать их в качестве обучающих данных. После сканирования бумажные экземпляры часто уничтожаются, что вызывает обеспокоенность среди архивариусов и владельцев библиотек. Этот процесс позволяет компаниям расширять наборы данных высококачественным контентом, защищенным авторским правом, для повышения точности и глубины знаний нейросетей.

Масштабная оцифровка редких фондов стала важным этапом в борьбе за качество обучающих выборок. В условиях дефицита качественных текстовых данных в интернете, компании обращаются к физическим архивам, которые ранее не были представлены в цифровом виде. Использование таких материалов позволяет моделям лучше понимать специфические исторические контексты, редкие языковые обороты и узкоспециализированные знания, недоступные в стандартных веб-дампах.

Однако практика физического уничтожения оригиналов после сканирования подвергается критике со стороны экспертов по сохранению культурного наследия. Существуют опасения, что такая стратегия ведет к безвозвратной потере уникальных артефактов, даже если их содержание переходит в цифровой формат. Вопрос легальности использования защищенных авторским правом произведений для обучения ИИ остается предметом активных дискуссий и судебных разбирательств между технологическими гигантами и правообладателями.

Ключевые факты

  • Компании скупают миллионы редких и вышедших из печати книг для создания специализированных датасетов.
  • Процесс включает высокоскоростное сканирование, после которого физические носители часто утилизируются.
  • Основная цель — получение уникальных текстовых данных для улучшения логических способностей и эрудиции LLM.
  • Действия разработчиков ИИ провоцируют конфликты с библиотечными сообществами и правообладателями из-за угрозы утраты культурного наследия.