Исследователи представили метод SR-OPSD (Self-Referenced On-Policy Self-Distillation), который оптимизирует обучение моделей через плотное токенизированное руководство. В отличие от стандартных подходов, использующих внешние сигналы или усредненные копии весов, новый метод опирается на самореферентное обучение, что позволяет эффективнее использовать разреженные награды и повышать качество генерации текста при работе с RL-алгоритмами.
Традиционные методы обучения с подкреплением (RL) часто сталкиваются с проблемой разреженности наград, когда модель получает обратную связь только в конце длинной последовательности действий. Техника OPSD решает это, превращая финальный результат в пошаговые инструкции для модели. Однако классические реализации часто зависят от «замороженных» копий модели, что ограничивает гибкость обучения и адаптивность системы к новым данным.
SR-OPSD устраняет эти ограничения, внедряя механизм самореференции, где текущая политика выступает в роли собственного учителя. Это позволяет модели более динамично корректировать свои вероятностные распределения на уровне отдельных токенов. Такой подход снижает зависимость от внешних критиков и позволяет более эффективно использовать вычислительные ресурсы при дообучении моделей на специфических задачах или при настройке под предпочтения пользователей.
Ключевые факты
- Метод SR-OPSD преобразует разреженные сигналы вознаграждения в плотное обучение на уровне токенов.
- Техника исключает необходимость использования стоп-градиентов или экспоненциального скользящего среднего (EMA) для копий политики.
- Метод направлен на улучшение стабильности обучения моделей в условиях, где традиционные RL-алгоритмы показывают низкую сходимость.
- Подход позволяет модели обучаться на собственных траекториях, минимизируя потребность в дополнительных внешних контекстах для учителя.