Исследователи представили ISO — специализированный стек оптимизации, предназначенный для обучения языковых моделей с использованием подкрепления на основе верифицируемых наград (RLVR). Авторы проанализировали процесс преобразования обратной связи от наград в обновление весов модели, выявив феномен «спектрального наследования», который позволяет эффективнее управлять обучением моделей с продвинутыми навыками рассуждения.
Метод RLVR становится стандартом для улучшения логических способностей LLM, однако механизмы оптимизации, стоящие за этим процессом, до сих пор оставались недостаточно изученными. В работе показано, что структура весов модели при обучении с подкреплением обладает уникальными свойствами, которые можно использовать для стабилизации процесса и повышения качества итоговых ответов.
Предложенный стек ISO позволяет глубже понять, как именно градиентные обновления влияют на внутренние представления модели. Это открывает возможности для создания более предсказуемых и эффективных алгоритмов дообучения, где верифицируемая обратная связь напрямую конвертируется в устойчивые изменения весовых коэффициентов, минимизируя деградацию базовых навыков модели.
Ключевые факты
- ISO (In-weight Spectral Optimization) фокусируется на оптимизации слоя, преобразующего сигналы наград в веса нейросети.
- Исследование опирается на анализ спектральной структуры весов, выявляя закономерности их изменения в процессе RLVR.
- Феномен «спектрального наследования» описывает, как модель сохраняет и адаптирует свои внутренние параметры при получении верифицируемой обратной связи.
- Работа направлена на устранение разрыва в понимании того, как именно RLVR-алгоритмы влияют на архитектурные изменения внутри LLM.