Сервис ISBNdb, предоставлявший доступ к базе данных метаданных и полных текстов печатных книг, прекратил практику их оцифровки для обучения нейросетей. Решение последовало за публикацией расследования 404 Media, вскрывшего использование защищенных авторским правом произведений без согласия правообладателей. Компания удалила соответствующие разделы сайта, признав спорность методов сбора данных для тренировочных датасетов.

Инцидент стал очередным примером конфликта между разработчиками ИИ и владельцами интеллектуальной собственности. ISBNdb позиционировала себя как поставщик структурированных данных для обучения моделей, предлагая API для доступа к миллионам записей. Однако расследование показало, что компания не только агрегировала метаданные, но и активно сканировала физические копии книг, что вызвало вопросы о законности использования контента в коммерческих целях.

Ситуация подчеркивает растущее давление на компании, занимающиеся сбором данных для обучения ИИ. Правообладатели и авторы все чаще выступают против несанкционированного использования их работ, что вынуждает агрегаторов пересматривать свои бизнес-модели и политику прозрачности. В настоящее время доступ к спорным разделам базы данных ISBNdb ограничен, а компания воздерживается от комментариев относительно будущих стратегий лицензирования контента.

Ключевые факты

  • Издание 404 Media опубликовало расследование, доказавшее, что ISBNdb оцифровывала книги для обучения ИИ без разрешения авторов.
  • Сервис ISBNdb предоставлял API для доступа к огромным массивам данных, включая метаданные и полные тексты произведений.
  • После публикации статьи компания удалила страницы, описывавшие процесс сканирования и использования книг для тренировки моделей.
  • Инцидент иллюстрирует ужесточение контроля над источниками данных, используемых для обучения больших языковых моделей.