Исследователи представили AI Reverse Engineering Benchmark (AREB) — специализированный набор тестов для оценки способности больших языковых моделей к анализу и декомпиляции программного кода. Бенчмарк фокусируется на задачах восстановления логики алгоритмов, понимании запутанного кода и поиске уязвимостей, что критически важно для автоматизации процессов кибербезопасности и глубокого анализа программного обеспечения с помощью ИИ.

Тестирование моделей в рамках AREB позволяет выявить пробелы в их способности рассуждать над низкоуровневыми структурами данных и ассемблерными инструкциями. В отличие от стандартных тестов на написание кода, данный бенчмарк требует от модели не создания нового функционала, а интерпретации уже существующего, что значительно сложнее с точки зрения логического вывода и контекстного понимания.

Результаты бенчмарка показывают, как современные LLM справляются с задачами реверс-инжиниринга в условиях ограниченной документации. Это помогает разработчикам инструментов для автоматизированного аудита кода лучше понимать ограничения текущих архитектур и направлять усилия на улучшение навыков моделей в области анализа сложных программных систем.

Ключевые факты

  • Бенчмарк включает задачи по анализу запутанного кода, декомпиляции и восстановлению алгоритмической логики.
  • Основная цель проекта — количественная оценка способности ИИ-моделей к выполнению задач обратной разработки.
  • Тесты охватывают различные уровни сложности, от простых функций до комплексных программных модулей.
  • Результаты AREB помогают оценить пригодность моделей для автоматизации аудита безопасности и поиска уязвимостей в ПО.