Исследователи представили ISO — специализированный стек оптимизации, предназначенный для обучения языковых моделей с использованием подкрепления на основе верифицируемых наград (RLVR). Авторы проанализировали процесс преобразования обратной связи от наград в обновление весов модели, выявив феномен «спектрального наследования», который позволяет эффективнее управлять обучением моделей с продвинутыми навыками рассуждения.

Метод RLVR становится стандартом для улучшения логических способностей LLM, однако механизмы оптимизации, стоящие за этим процессом, до сих пор оставались недостаточно изученными. В работе показано, что структура весов модели при обучении с подкреплением обладает уникальными свойствами, которые можно использовать для стабилизации процесса и повышения качества итоговых ответов.

Предложенный стек ISO позволяет глубже понять, как именно градиентные обновления влияют на внутренние представления модели. Это открывает возможности для создания более предсказуемых и эффективных алгоритмов дообучения, где верифицируемая обратная связь напрямую конвертируется в устойчивые изменения весовых коэффициентов, минимизируя деградацию базовых навыков модели.

Ключевые факты

  • ISO (In-weight Spectral Optimization) фокусируется на оптимизации слоя, преобразующего сигналы наград в веса нейросети.
  • Исследование опирается на анализ спектральной структуры весов, выявляя закономерности их изменения в процессе RLVR.
  • Феномен «спектрального наследования» описывает, как модель сохраняет и адаптирует свои внутренние параметры при получении верифицируемой обратной связи.
  • Работа направлена на устранение разрыва в понимании того, как именно RLVR-алгоритмы влияют на архитектурные изменения внутри LLM.