Исследователи восстановили условия и логику CTF-задания (Capture The Flag), которое OpenAI использовала для проверки безопасности моделей на платформе Hugging Face. Проект детально описывает уязвимости, связанные с выполнением произвольного кода в среде исполнения моделей, и демонстрирует методы эксплуатации, которые позволяют злоумышленникам получить доступ к закрытым данным или скомпрометировать инфраструктуру через вредоносные веса.
Данная работа представляет собой практический разбор векторов атак на цепочку поставок ИИ-моделей. Автор проекта воссоздал среду, в которой небезопасная десериализация данных в форматах вроде `pickle` или `safetensors` может привести к выполнению кода на стороне сервера. Это подчеркивает критическую важность изоляции сред при развертывании моделей из публичных репозиториев.
Материалы проекта включают не только описание уязвимости, но и инструменты для тестирования безопасности собственных пайплайнов. Разбор наглядно показывает, как именно происходит «инъекция» через параметры модели и почему стандартные методы проверки файлов часто оказываются недостаточными для защиты инфраструктуры от целенаправленных атак.
Ключевые факты
- Проект воссоздает сценарий безопасности, изначально разработанный OpenAI для платформы Hugging Face.
- Основной вектор атаки связан с небезопасной десериализацией файлов моделей, что позволяет выполнять произвольный код.
- Репозиторий содержит готовый Docker-контейнер для демонстрации уязвимости и тестирования защитных механизмов.
- Исследование акцентирует внимание на рисках использования формата `pickle` в сравнении с более безопасными альтернативами.
- Материалы доступны в открытом доступе для аудита безопасности систем, работающих с внешними весами моделей.