Исследование показало, что автономные ИИ-агенты пока не способны эффективно устранять критические уязвимости в программном обеспечении без участия человека. Несмотря на способность моделей генерировать патчи, они часто допускают ошибки, которые создают новые бреши в безопасности или нарушают работоспособность системы. Текущие инструменты требуют обязательного контроля со стороны инженеров для проверки корректности предлагаемых исправлений.

В ходе тестирования различных LLM выяснилось, что автоматизация процесса патчинга сталкивается с проблемой «галлюцинаций» кода и неспособностью моделей учитывать сложный контекст архитектуры крупных проектов. ИИ успешно справляется с простыми синтаксическими ошибками, но при работе с комплексными уязвимостями, требующими глубокого понимания бизнес-логики, процент успешных и безопасных исправлений остается низким.

Результаты подчеркивают разрыв между возможностями генеративного ИИ в написании кода и его надежностью в задачах кибербезопасности. Компании, внедряющие подобные решения в свои CI/CD пайплайны, вынуждены сохранять «человека в контуре» (human-in-the-loop) для верификации каждого изменения, что ограничивает потенциал полной автоматизации процессов исправления багов.

Ключевые факты

  • Автономные системы часто создают вторичные уязвимости при попытке исправить исходную проблему.
  • ИИ демонстрирует высокую точность на простых задачах, но теряет эффективность при работе с комплексными архитектурными зависимостями.
  • Необходимость ручной проверки кода остается главным барьером для масштабирования ИИ-агентов в отделах информационной безопасности.
  • Исследование подтверждает, что текущие модели не обладают достаточным уровнем «понимания» контекста для замены квалифицированных разработчиков в задачах по защите ПО.