Исследователи представили метод β-OPSD, который оптимизирует процесс обучения моделей через самодистилляцию. Авторы доказали, что стандартная техника OPSD является частным случаем более широкого семейства алгоритмов, где коэффициент β регулирует штраф KL-дивергенции. Настройка этого параметра позволяет значительно повысить стабильность обучения и качество логических рассуждений моделей, устраняя необходимость в сложных инженерных доработках, характерных для классических подходов.
Традиционные методы самодистилляции часто оказываются нестабильными, так как жесткая привязка студенческой модели к учителю ограничивает пространство для поиска оптимальных стратегий. Введение параметра β позволяет гибко управлять степенью консерватизма при обновлении весов. Это дает возможность модели эффективнее усваивать сложные паттерны рассуждений, не теряя при этом стабильности, что критически важно при масштабировании процесса обучения на больших наборах данных.
Разработанный подход упрощает пайплайны дообучения, делая процесс предсказуемым. Вместо ручной подстройки гиперпараметров на каждом этапе, β-OPSD предлагает математически обоснованный способ балансировки между следованием стратегии учителя и поиском новых, более эффективных путей решения задач. Это открывает возможности для более качественного обучения моделей, ориентированных на сложные цепочки рассуждений (Chain-of-Thought).
Ключевые факты
- β-OPSD расширяет стандартный метод On-policy self-distillation (OPSD), рассматривая его как частный случай при β=1.
- Параметр β выступает в роли весового коэффициента для KL-штрафа, удерживающего модель в рамках заданной стратегии.
- Метод направлен на решение проблемы хрупкости обучения (brittleness), требующей значительных инженерных усилий в текущих реалиях.
- Техника ориентирована на улучшение способностей языковых моделей к логическим рассуждениям и последовательному мышлению.