Разработчики ИИ-моделей переключились на закупку прав на оцифрованные архивы старых книг, чтобы обеспечить чистоту обучающих выборок. В условиях перенасыщения интернета низкокачественным ИИ-контентом, данные из книг, изданных до эпохи генеративных моделей, становятся критически важным ресурсом для поддержания высокого качества ответов LLM и предотвращения деградации моделей из-за «отравления» синтетическими данными.
Компании стремятся минимизировать использование данных из социальных сетей и открытых веб-ресурсов, которые всё чаще содержат сгенерированный мусор. Старые книги предлагают структурированный, качественный и логически связный текст, прошедший профессиональную редактуру. Это позволяет улучшить способности моделей к рассуждению и снизить вероятность появления галлюцинаций, характерных для систем, обученных на «шумных» данных из интернета.
Помимо качества, использование оцифрованных архивов решает проблему авторских прав. Компании предпочитают заключать прямые сделки с издательствами и библиотеками, чтобы получить доступ к легальным корпусам текстов. Это создает новый рынок данных, где ценность контента определяется его «человеческим» происхождением и отсутствием следов автоматизированной генерации.
Ключевые факты
- Разработчики ИИ активно скупают права на оцифрованные библиотеки, чтобы избежать обучения на «мусорном» контенте (AI slop).
- Тексты, созданные до появления генеративных моделей, считаются эталонными для обучения LLM из-за высокого качества языка и логики.
- Использование архивов книг помогает компаниям снизить риски, связанные с авторским правом и юридическими претензиями.
- Качество обучающих данных становится главным конкурентным преимуществом в условиях дефицита высококачественного контента в открытом доступе.