Hugging Face представила публичный сервис, позволяющий разработчикам проверить, содержится ли их код в составе масштабного набора данных The Stack v2. Этот датасет, состоящий из более чем 600 терабайт исходного кода на 600 языках программирования, является фундаментальной базой для обучения современных моделей генерации кода, таких как StarCoder2.

Инструмент предоставляет прозрачность в вопросах использования открытого кода для тренировки нейросетей. Разработчики могут ввести URL-адрес своего репозитория или имя пользователя, чтобы узнать, был ли их контент включен в обучающую выборку. Это важный шаг в сторону этичного использования данных, позволяющий авторам контролировать присутствие своих наработок в составе глобальных ИИ-моделей.

Помимо функции поиска, сервис предлагает механизм для удаления данных. Если владелец репозитория не желает, чтобы его код использовался в будущих итерациях обучения, он может подать запрос на исключение через интерфейс платформы. Это соответствует принципам открытости и соблюдения авторских прав, которые Hugging Face активно продвигает в рамках своих инициатив по работе с большими данными.

Ключевые факты

  • The Stack v2 содержит более 600 ТБ данных и охватывает 600 языков программирования.
  • Сервис позволяет искать код по URL репозитория или имени пользователя на GitHub.
  • Набор данных используется для обучения моделей StarCoder2 и других инструментов генерации кода.
  • Платформа предоставляет встроенный механизм для подачи запросов на удаление (opt-out) кода из будущих обучающих выборок.
  • Инструмент направлен на повышение прозрачности процесса обучения LLM на открытых данных.