Исследование оценивает способность современных больших языковых моделей автоматизировать триаж результатов статического анализа кода (SAST). В ходе эксперимента проверялось, насколько точно модели могут определять, является ли найденная уязвимость реальной угрозой или ложным срабатыванием. Результаты показывают, что использование LLM позволяет значительно снизить нагрузку на специалистов по безопасности, отсеивая до 80% неактуальных уведомлений при сохранении высокой точности обнаружения критических багов.

Инструменты статического анализа часто генерируют огромное количество «шума», что приводит к усталости разработчиков и игнорированию реальных угроз. Авторы исследования протестировали ряд популярных моделей, включая GPT-4o и Claude 3.5 Sonnet, на реальных наборах данных с результатами сканирования кода. Основная сложность заключалась в необходимости глубокого понимания контекста приложения, который часто выходит за рамки одного файла, анализируемого классическими SAST-инструментами.

Внедрение LLM в пайплайны безопасности позволяет автоматизировать процесс классификации, превращая поток необработанных данных в приоритизированный список задач. Это сокращает время на ручной аудит и позволяет командам фокусироваться на устранении действительно опасных уязвимостей, а не на проверке сотен ложных предупреждений, генерируемых автоматизированными системами.

Ключевые факты

  • Исследование сфокусировано на автоматизации триажа результатов SAST с помощью LLM.
  • Модели продемонстрировали способность снижать количество ложноположительных срабатываний до 80%.
  • В тестировании использовались модели GPT-4o и Claude 3.5 Sonnet.
  • Основным преимуществом подхода является способность моделей учитывать контекст проекта при анализе уязвимостей.
  • Автоматизация позволяет значительно сократить время, затрачиваемое инженерами на ручную проверку отчетов безопасности.