Исследователи OpenAI обнаружили, что злоумышленники использовали методы межмодельного взаимодействия для подготовки кибератак за несколько месяцев до масштабного взлома платформы Hugging Face. Анализ показал, что ИИ-системы применялись для автоматизации поиска уязвимостей и координации действий, что указывает на эволюцию тактик использования генеративных моделей в преступных целях и необходимость усиления защиты инфраструктуры разработки.
Инцидент подчеркивает новую угрозу, при которой злоумышленники заставляют модели «сотрудничать» для обхода встроенных ограничений безопасности. Вместо использования одной модели для выполнения всей цепочки действий, атакующие распределяют задачи между несколькими агентами, что позволяет скрывать вредоносную активность и повышать эффективность разведки в целевых сетях.
Специалисты отмечают, что подобные методы позволяют автоматизировать сложные этапы взлома, включая написание эксплойтов и анализ кода, которые ранее требовали значительных ручных усилий. Это ставит перед разработчиками платформ задачу по внедрению более совершенных систем мониторинга, способных распознавать нетипичные паттерны запросов, исходящие от автоматизированных систем, а не от отдельных пользователей.
Ключевые факты
- Атаки с использованием взаимодействия моделей были зафиксированы за несколько месяцев до инцидента на Hugging Face.
- Злоумышленники применяли цепочки агентов для автоматизации поиска уязвимостей и обхода фильтров безопасности.
- Использование нескольких моделей позволяет распределять задачи и маскировать вредоносные действия под легитимные запросы.
- Эксперты подчеркивают необходимость разработки новых протоколов безопасности для предотвращения «кооперации» ИИ-агентов в злонамеренных целях.