Исследователи проанализировали более 230 тысяч ИИ-артефактов на платформах Hugging Face и GitHub, чтобы оценить соблюдение лицензионных условий при передаче данных и моделей. Выяснилось, что в цепочках поставок ИИ происходит «отмывание лицензий»: обязательства по атрибуции и сохранению условий использования часто игнорируются или заменяются при перемещении контента между платформами и проектами.

Проблема заключается в отсутствии механизмов автоматического отслеживания лицензионных требований при репозиции или дообучении моделей. Когда разработчики берут открытые датасеты или веса моделей, они часто не включают исходные лицензионные соглашения в финальный продукт. Это создает юридические риски для компаний, использующих такие компоненты в коммерческих целях, так как цепочка происхождения данных становится непрозрачной.

Авторы работы подчеркивают, что текущая инфраструктура обмена ИИ-артефактами не поддерживает передачу метаданных о лицензиях. Это приводит к тому, что производные модели часто распространяются под более свободными или вовсе неверными лицензиями, чем исходные материалы. Подобная практика подрывает доверие к открытым экосистемам и ставит под угрозу правовую чистоту проектов, использующих сторонние наработки.

Ключевые факты

  • Проанализировано 232 270 ИИ-артефактов, включая датасеты и веса моделей.
  • Исследование охватило цепочки поставок между платформами Hugging Face и GitHub.
  • Выявлено систематическое удаление или подмена лицензионных обязательств при копировании и модификации контента.
  • Отсутствие автоматизированных инструментов для трекинга лицензий создает значительные риски нарушения авторских прав в downstream-проектах.