Исследователи из Калифорнийского университета в Беркли представили ExploitGym — специализированную среду для тестирования возможностей больших языковых моделей в автоматизированном поиске и эксплуатации уязвимостей. Инструмент позволяет оценивать эффективность ИИ-агентов в задачах кибербезопасности, предоставляя стандартизированную платформу для измерения прогресса моделей в написании эксплойтов и анализе защищенности программного обеспечения в контролируемых условиях.
Бенчмарк фокусируется на задачах, требующих от модели глубокого понимания кода, логики работы операционных систем и специфических векторов атак. В отличие от общих тестов на написание кода, ExploitGym создает среду, где агент должен не просто сгенерировать корректный синтаксис, но и успешно преодолеть механизмы защиты, имитируя реальные сценарии работы специалистов по информационной безопасности.
Разработка призвана стандартизировать оценку моделей в области наступательной безопасности. Использование подобных инструментов позволяет исследователям отслеживать, насколько современные архитектуры способны к автономному выполнению сложных многошаговых действий, требующих планирования и итеративного тестирования гипотез при поиске критических уязвимостей в программных продуктах.
Ключевые факты
- ExploitGym разработан исследователями из группы Sunblaze в Калифорнийском университете в Беркли.
- Среда предназначена для автоматизированного тестирования способностей LLM в поиске и эксплуатации уязвимостей.
- Инструментарий ориентирован на оценку автономных агентов, способных к итеративному выполнению сложных задач в сфере кибербезопасности.
- Исходный код проекта опубликован на GitHub для обеспечения прозрачности и воспроизводимости результатов исследований.