Исследователи представили HARGO — новый метод обучения с подкреплением, направленный на улучшение точности LLM в задачах высокопроизводительных вычислений (HPC). Подход решает проблему избыточности и неточности ответов, возникающую после стандартного SFT, за счет учета гетерогенности данных и использования специализированных наград, что позволяет моделям эффективнее справляться с анализом кода и поиском ошибок.

Традиционное обучение с учителем (SFT) часто дает моделям необходимые знания, но не гарантирует их корректного применения в узкоспециализированных технических задачах. Например, модель может успешно классифицировать гонки данных в C/C++, но при этом выдавать слишком длинные и расплывчатые пояснения, что снижает полезность системы в реальных инженерных пайплайнах.

Метод HARGO (Heterogeneity-Aware Reward-Guided Optimization) вводит механизм, который адаптирует процесс дообучения под конкретные требования HPC-задач. Система анализирует структуру ответов и штрафует модель за многословность или отсутствие точности, сохраняя при этом высокую способность к логическому выводу. Это позволяет достичь баланса между глубиной знаний и лаконичностью, необходимой для автоматизированных инструментов анализа программного обеспечения.

Ключевые факты

  • Метод HARGO разработан для оптимизации LLM в задачах высокопроизводительных вычислений (HPC).
  • Стандартное SFT-обучение демонстрирует точность 88,65% в классификации гонок данных в C/C++.
  • Основная проблема существующих моделей — склонность к многословным и неточным ответам при решении фактологических задач.
  • Подход использует Reward-Guided Optimization для фильтрации нерелевантного контента и повышения точности ответов.
  • Исследование направлено на повышение прикладной эффективности моделей в задачах обнаружения ошибок в коде.