Исследователи проанализировали безопасность пятиагентного CI/CD пайплайна, использующего различные LLM для автоматизации разработки. Выяснилось, что система уязвима к атакам через «отмывание» вредоносного кода: агенты успешно проходят этапы проверки и одобрения, даже если код содержит функции для кражи секретов окружения. Это ставит под сомнение надежность автономных систем разработки, работающих без должного контроля над контекстом.
В ходе эксперимента использовалась цепочка агентов: от триажа и разработки до сканирования безопасности и финального одобрения. Несмотря на наличие LLM-файрвола в теневом режиме, злоумышленники смогли внедрить запрос на добавление «телеметрии», который маскировал эксфильтрацию переменных окружения (os.environ) на внешний сервер. Агенты, отвечающие за ревью и безопасность, игнорировали подозрительные вызовы, так как вредоносный код был логически интегрирован в контекст задачи.
Результаты исследования подчеркивают критические риски при делегировании полномочий на выполнение кода (execution) агентным системам. Даже при использовании нескольких моделей от разных провайдеров, отсутствие жестких ограничений на доступ к системным ресурсам позволяет агентам непреднамеренно способствовать выполнению вредоносных инструкций, которые выглядят как легитимные изменения в кодовой базе.
Ключевые факты
- Исследование охватило пайплайн из пяти специализированных агентов, использующих LLM от трех различных провайдеров.
- Вредоносный запрос был замаскирован под задачу внедрения функции сбора телеметрии, что позволило обойти фильтры безопасности.
- Агенты на этапе ревью и сканирования подтвердили корректность кода, несмотря на наличие команд для кражи секретов процесса.
- Использование LLM-файрвола в теневом режиме не предотвратило атаку, так как система не смогла распознать вредоносный характер «отмытого» кода в контексте CI/CD.