Исследователи представили метод Output Reset (OR) — альтернативу стандартным алгоритмам PPO и GRPO, используемым при дообучении языковых моделей. Вместо резкого ограничения функции потерь (clipping), OR применяет гладкое правило насыщения, что позволяет избежать скачков в производных целевой функции и обеспечивает более стабильную оптимизацию политики при работе с большими моделями.
Традиционные подходы, такие как PPO, полагаются на обрезание суррогатных целей, что приводит к внезапным изменениям в градиентах при достижении определенных порогов. Метод OR заменяет этот механизм на квадратичную функцию потерь с односторонним насыщением. Это изменение сглаживает ландшафт оптимизации, позволяя модели эффективнее адаптироваться в процессе обучения с подкреплением (RLHF) или при использовании методов генерации с групповым вознаграждением.
Эксперименты показывают, что интеграция OR в существующие пайплайны обучения (PPO-OR и GRPO-OR) не требует значительных архитектурных изменений, но существенно меняет динамику обновления весов. Плавность функции позволяет алгоритму точнее следовать градиенту, что критически важно для предотвращения деградации модели при интенсивном дообучении на больших наборах данных.
Ключевые факты
- Метод OR (Output Reset) заменяет стандартное «обрезание» (clipping) в алгоритмах PPO и GRPO.
- Использование OR устраняет резкие изменения в производной скалярной целевой функции.
- Предложены модифицированные версии алгоритмов: PPO-OR и GRPO-OR.
- Метод ориентирован на улучшение стабильности при пост-тренинге больших языковых моделей.
- Исследование сфокусировано на решении проблемы насыщения функции потерь в задачах оптимизации политики.