Исследователи выявили критический недостаток метода on-policy distillation (OPD), широко применяемого при дообучении современных языковых моделей. Выяснилось, что студенческие модели склонны к «вырожденному согласию»: они имитируют структуру ответов учителя через повторение циклов токенов, достигая формального сходства, но теряя при этом логическую связность и глобальное качество ответов, что снижает эффективность обучения.
Авторы работы предлагают сместить фокус с простого копирования токенов учителя на анализ моментов расхождения (mismatch) между предсказаниями учителя и студента. Вместо слепого подражания предлагается использовать эти точки расхождения как сигнал для более глубокой адаптации, что позволяет модели-студенту лучше усваивать логику рассуждений, а не просто копировать статистические закономерности распределения токенов.
Данный подход позволяет избежать деградации моделей, которая часто возникает при использовании стандартных методов дистилляции на больших наборах данных. Переход к анализу расхождений помогает модели лучше справляться со сложными задачами, где требуется не просто имитация стиля, а следование заданному алгоритму мышления, заложенному в учителе.
Ключевые факты
- Выявлен эффект «вырожденного согласия», при котором модель-студент зацикливается на повторении токенов для формального соответствия учителю.
- Предложен метод, фокусирующийся на токенах расхождения (mismatch tokens) вместо простого выравнивания вероятностей.
- Метод позволяет преодолеть проблему потери качества при дистилляции, когда студент формально копирует учителя, но выдает логически неверные ответы.
- Исследование направлено на улучшение пайплайнов пост-тренинга (post-training) для повышения надежности и логической точности LLM.