Исследование показало, что автономные ИИ-агенты пока не способны эффективно устранять критические уязвимости в программном обеспечении без участия человека. Несмотря на способность моделей генерировать патчи, они часто допускают ошибки, которые создают новые бреши в безопасности или нарушают работоспособность системы. Текущие инструменты требуют обязательного контроля со стороны инженеров для проверки корректности предлагаемых исправлений.
В ходе тестирования различных LLM выяснилось, что автоматизация процесса патчинга сталкивается с проблемой «галлюцинаций» кода и неспособностью моделей учитывать сложный контекст архитектуры крупных проектов. ИИ успешно справляется с простыми синтаксическими ошибками, но при работе с комплексными уязвимостями, требующими глубокого понимания бизнес-логики, процент успешных и безопасных исправлений остается низким.
Результаты подчеркивают разрыв между возможностями генеративного ИИ в написании кода и его надежностью в задачах кибербезопасности. Компании, внедряющие подобные решения в свои CI/CD пайплайны, вынуждены сохранять «человека в контуре» (human-in-the-loop) для верификации каждого изменения, что ограничивает потенциал полной автоматизации процессов исправления багов.
Ключевые факты
- Автономные системы часто создают вторичные уязвимости при попытке исправить исходную проблему.
- ИИ демонстрирует высокую точность на простых задачах, но теряет эффективность при работе с комплексными архитектурными зависимостями.
- Необходимость ручной проверки кода остается главным барьером для масштабирования ИИ-агентов в отделах информационной безопасности.
- Исследование подтверждает, что текущие модели не обладают достаточным уровнем «понимания» контекста для замены квалифицированных разработчиков в задачах по защите ПО.