Исследователи представили метод DASH (Divergence-Adaptive Supervision Horizons), оптимизирующий процесс обучения моделей рассуждения с помощью он-полиси самодистилляции. Новый подход решает проблему разреженности сигналов вознаграждения, динамически адаптируя горизонт надзора в зависимости от расхождения между студентом и учителем. Это позволяет эффективно использовать плотные токеновые сигналы, повышая точность логических выводов модели.
Традиционное обучение с подкреплением на основе проверяемых наград (RLVR) часто сталкивается с тем, что сигналы обратной связи приходят только в конце генерации всей последовательности. Метод DASH позволяет модели-студенту получать более детальные инструкции от привилегированного учителя на промежуточных этапах генерации. Адаптивный механизм определяет, когда именно стоит полагаться на подсказки учителя, минимизируя накопление ошибок и ускоряя сходимость при обучении сложным цепочкам рассуждений.
Технология фокусируется на балансе между исследованием пространства ответов и следованием экспертным траекториям. За счет динамического изменения «горизонта» обучения, модель эффективнее усваивает структуру логических переходов, что критически важно для задач, требующих многошагового планирования и математической точности. Подход демонстрирует значительное преимущество перед стандартными методами дистилляции, обеспечивая более стабильное обучение в условиях ограниченных данных для проверки.
Ключевые факты
- DASH внедряет адаптивный горизонт надзора, который меняется в зависимости от уровня расхождения (divergence) между политиками студента и учителя.
- Метод решает проблему разреженности наград в RLVR, предоставляя плотные сигналы на уровне отдельных токенов в процессе генерации.
- Подход оптимизирует он-полиси самодистилляцию (OPSD), снижая зависимость от редких финальных сигналов проверки.
- Техника направлена на повышение качества моделей рассуждения (reasoning models) за счет более точного управления процессом обучения на промежуточных префиксах.