Исследователи проанализировали эффективность использования различных LLM для рецензирования кода, написанного другими моделями. Работа показывает, что кросс-модельная проверка позволяет выявлять специфические ошибки, которые пропускают отдельные архитектуры. Использование более мощных моделей в качестве ревьюеров для кода, сгенерированного специализированными инструментами, значительно повышает качество итогового программного обеспечения, снижая количество логических уязвимостей и синтаксических неточностей в автоматизированных пайплайнах.

В рамках эксперимента сравнивались результаты работы моделей Claude, Codex и других популярных архитектур. Авторы статьи сфокусировались на том, как иерархический подход к проверке кода влияет на общую надежность генерации. Выяснилось, что «перекрестный» аудит позволяет компенсировать галлюцинации одной модели за счет логического анализа другой, что особенно актуально для сложных репозиториев, где требуется соблюдение строгих стандартов кодирования.

Методология исследования включает оценку точности исправления багов в зависимости от того, какая модель выступает в роли «автора», а какая — в роли «рецензента». Результаты указывают на то, что выбор пары моделей для связки «генерация-проверка» критически важен для минимизации технического долга. Данный подход предлагает новый стандарт для построения агентных систем, где автоматизированное написание кода дополняется многоуровневым контролем качества.

Ключевые факты

  • Исследование охватывает взаимодействие между моделями Claude, Codex и рядом других LLM для задач программной инженерии.
  • Установлено, что кросс-модельное рецензирование снижает количество логических ошибок в коде на 15–22% по сравнению с одиночной генерацией.
  • Выявлена зависимость эффективности проверки от «размерности» модели-рецензента: более крупные модели стабильнее обнаруживают ошибки в коде, написанном компактными специализированными моделями.
  • Авторы предложили метрику «Cross-Review Accuracy», позволяющую оценивать пригодность конкретных пар моделей для интеграции в CI/CD процессы.
  • Работа подчеркивает важность разделения ролей генерации и верификации в агентных архитектурах для повышения безопасности кода.