Исследователи проанализировали более 230 тысяч ИИ-артефактов на платформах Hugging Face и GitHub, чтобы оценить соблюдение лицензионных условий при передаче данных и моделей. Выяснилось, что в цепочках поставок ИИ происходит «отмывание лицензий»: обязательства по атрибуции и сохранению условий использования часто игнорируются или заменяются при перемещении контента между платформами и проектами.
Проблема заключается в отсутствии механизмов автоматического отслеживания лицензионных требований при репозиции или дообучении моделей. Когда разработчики берут открытые датасеты или веса моделей, они часто не включают исходные лицензионные соглашения в финальный продукт. Это создает юридические риски для компаний, использующих такие компоненты в коммерческих целях, так как цепочка происхождения данных становится непрозрачной.
Авторы работы подчеркивают, что текущая инфраструктура обмена ИИ-артефактами не поддерживает передачу метаданных о лицензиях. Это приводит к тому, что производные модели часто распространяются под более свободными или вовсе неверными лицензиями, чем исходные материалы. Подобная практика подрывает доверие к открытым экосистемам и ставит под угрозу правовую чистоту проектов, использующих сторонние наработки.
Ключевые факты
- Проанализировано 232 270 ИИ-артефактов, включая датасеты и веса моделей.
- Исследование охватило цепочки поставок между платформами Hugging Face и GitHub.
- Выявлено систематическое удаление или подмена лицензионных обязательств при копировании и модификации контента.
- Отсутствие автоматизированных инструментов для трекинга лицензий создает значительные риски нарушения авторских прав в downstream-проектах.