Исследователи представили HoF-Bench — специализированный бенчмарк для оценки способности ИИ-моделей находить критические уязвимости в коде. В отличие от синтетических тестов, набор данных базируется на 95 реальных CVE, обнаруженных ИИ-анализатором AISLE в крупных open-source проектах. Инструмент позволяет проверять эффективность систем безопасности на реальных примерах, где ИИ уже доказал свою способность находить ошибки в зрелых кодовых базах.

Разработка бенчмарка стала ответом на прогресс в области автоматизированного анализа кода. Ранее подобные задачи требовали участия передовых моделей, однако HoF-Bench ориентирован на проверку инструментов, способных выявлять уязвимости без необходимости использования самых дорогих и мощных LLM. Это позволяет разработчикам точнее оценивать пригодность специализированных анализаторов для интеграции в процессы CI/CD и обеспечения безопасности программного обеспечения.

Использование реальных CVE, зафиксированных в репозиториях OpenSSL, curl и GnuTLS, обеспечивает высокую репрезентативность тестов. Авторы проекта сфокусировались на том, чтобы зафиксировать состояние кода в момент совершения уязвимости, создавая среду, максимально приближенную к реальным условиям эксплуатации программных продуктов. Такой подход помогает выявить пробелы в логике анализаторов и улучшить их способность к обнаружению сложных векторов атак.

Ключевые факты

  • HoF-Bench включает 95 реальных CVE, найденных ИИ в 8 крупных open-source репозиториях.
  • Анализатор AISLE, на данных которого построен бенчмарк, обнаружил более 280 CVE в 78 проектах.
  • В выборку вошли такие значимые проекты, как OpenSSL, curl и GnuTLS.
  • Бенчмарк сфокусирован на оценке инструментов, способных находить уязвимости без использования фронтирных LLM-моделей.