Исследователи изучили эффективность оптимизатора Muon в задачах агентного обучения с подкреплением (RL) при работе с разреженными наградами. В ходе экспериментов на модели Qwen2.5-0.5B-Instruct в среде ALFWorld выяснилось, что применение Muon к скрытым весовым матрицам в рамках алгоритма GiGPO обеспечивает значительный прирост производительности по сравнению с традиционным оптимизатором AdamW, демонстрируя потенциал для оптимизации агентных систем.

Традиционно Muon зарекомендовал себя как эффективная альтернатива AdamW при крупномасштабном предварительном обучении моделей. Однако его применимость на этапе пост-обучения агентов оставалась малоизученной. Авторы работы провели серию сравнений, чтобы определить, в каких именно сценариях этот метод оптимизации дает преимущество, фокусируясь на задачах, где агенты сталкиваются с редкими сигналами вознаграждения.

Результаты показывают, что выборочное использование Muon позволяет достичь более стабильных результатов в финальных окнах обучения. Это открывает новые возможности для настройки агентных архитектур, где эффективность обновления весов напрямую влияет на способность агента выполнять сложные последовательности действий в интерактивных средах.

Ключевые факты

  • Исследование сфокусировано на сравнении оптимизаторов Muon и AdamW в контексте агентного RL.
  • Эксперименты проводились в среде ALFWorld с использованием модели Qwen2.5-0.5B-Instruct.
  • Применение Muon ограничено скрытыми весовыми матрицами в рамках метода Group-in-Group Policy Optimization (GiGPO).
  • Использование Muon показало преимущество в задачах с разреженными наградами, улучшая показатели в финальных стадиях обучения.