Исследователи представили новый метод атак на системы автоматизированного поиска уязвимостей в коде, основанные на LLM. Адаптивные агентные атаки используют специально сформированные комментарии, которые обходят механизмы защиты, заставляя модели игнорировать критические дефекты. Это ставит под сомнение надежность существующих инструментов безопасности, полагающихся исключительно на ИИ-анализ для проверки программного обеспечения перед релизом.
В ходе экспериментов авторы продемонстрировали, что даже продвинутые модели, обученные на обнаружение эксплойтов, уязвимы к манипуляциям через контекстные подсказки. Атаки строятся на принципе «состязательных комментариев», которые внедряются в исходный код. Эти вставки не меняют логику программы, но эффективно дезориентируют агент-детектор, блокируя его способность идентифицировать реальные угрозы безопасности или внедряя ложные срабатывания.
Данная работа подчеркивает необходимость разработки более устойчивых методов верификации кода. Использование LLM в качестве единственного арбитра безопасности становится рискованным без дополнительных уровней проверки, таких как статический анализ или формальные методы верификации. Исследование предлагает новый подход к тестированию самих систем безопасности, чтобы выявить их «слепые зоны» до того, как они будут использованы злоумышленниками в реальных средах разработки.
Ключевые факты
- Метод атак направлен на LLM-детекторы, используемые для автоматического поиска уязвимостей в коде.
- Атаки используют состязательные комментарии, которые обходят фильтры безопасности без изменения функциональности кода.
- Исследование показывает, что текущие агентные системы поиска уязвимостей имеют критические пробелы в устойчивости к манипуляциям.
- Предложенный подход позволяет злоумышленникам скрывать вредоносные паттерны от автоматизированных систем контроля качества.