Исследователи Truffle Security просканировали 7,6 петабайта данных, используемых для обучения ИИ-моделей на платформе Hugging Face, с целью поиска случайно опубликованных секретов. Анализ выявил тысячи критических уязвимостей, включая API-ключи, токены доступа и учетные данные, которые могли попасть в обучающие выборки вместе с открытым кодом и документацией.
Масштабное исследование показало, что проблема «отравления» данных секретами носит системный характер. Разработчики часто загружают на публичные платформы репозитории, содержащие файлы конфигурации с жестко закодированными ключами. Поскольку эти данные становятся частью датасетов для обучения LLM, существует риск, что модели могут «запомнить» и впоследствии выдать эти секреты в ответ на специфические запросы пользователей.
Авторы подчеркивают, что автоматизированные системы фильтрации данных при подготовке обучающих выборок часто пропускают сложные форматы секретов. Это создает угрозу безопасности цепочки поставок ИИ, так как скомпрометированные ключи могут быть использованы для несанкционированного доступа к облачной инфраструктуре, базам данных или платным API, которые были интегрированы в процессы разработки.
Ключевые факты
- Объем просканированных данных составил 7,6 петабайта, размещенных на платформе Hugging Face.
- В ходе проверки обнаружены тысячи активных API-ключей и токенов, принадлежащих различным облачным провайдерам и сервисам.
- Исследование подтвердило, что секреты попадают в модели через публичные датасеты, что делает их потенциально доступными для извлечения через промпт-инжиниринг.
- Основным источником утечек являются файлы конфигурации и логи, случайно включенные в состав публичных репозиториев.
- Результаты подчеркивают необходимость внедрения инструментов сканирования секретов на этапе подготовки данных для обучения (pre-training) и дообучения (fine-tuning) моделей.