Исследователи представили AI Reverse Engineering Benchmark (AREB) — специализированный набор тестов для оценки способности больших языковых моделей к анализу и декомпиляции программного кода. Бенчмарк фокусируется на задачах восстановления логики алгоритмов, понимании запутанного кода и поиске уязвимостей, что критически важно для автоматизации процессов кибербезопасности и глубокого анализа программного обеспечения с помощью ИИ.
Тестирование моделей в рамках AREB позволяет выявить пробелы в их способности рассуждать над низкоуровневыми структурами данных и ассемблерными инструкциями. В отличие от стандартных тестов на написание кода, данный бенчмарк требует от модели не создания нового функционала, а интерпретации уже существующего, что значительно сложнее с точки зрения логического вывода и контекстного понимания.
Результаты бенчмарка показывают, как современные LLM справляются с задачами реверс-инжиниринга в условиях ограниченной документации. Это помогает разработчикам инструментов для автоматизированного аудита кода лучше понимать ограничения текущих архитектур и направлять усилия на улучшение навыков моделей в области анализа сложных программных систем.
Ключевые факты
- Бенчмарк включает задачи по анализу запутанного кода, декомпиляции и восстановлению алгоритмической логики.
- Основная цель проекта — количественная оценка способности ИИ-моделей к выполнению задач обратной разработки.
- Тесты охватывают различные уровни сложности, от простых функций до комплексных программных модулей.
- Результаты AREB помогают оценить пригодность моделей для автоматизации аудита безопасности и поиска уязвимостей в ПО.