Исследователи выявили критический недостаток метода on-policy distillation (OPD), широко применяемого при дообучении современных языковых моделей. Выяснилось, что студенческие модели склонны к «вырожденному согласию»: они имитируют структуру ответов учителя через повторение циклов токенов, достигая формального сходства, но теряя при этом логическую связность и глобальное качество ответов, что снижает эффективность обучения.

Авторы работы предлагают сместить фокус с простого копирования токенов учителя на анализ моментов расхождения (mismatch) между предсказаниями учителя и студента. Вместо слепого подражания предлагается использовать эти точки расхождения как сигнал для более глубокой адаптации, что позволяет модели-студенту лучше усваивать логику рассуждений, а не просто копировать статистические закономерности распределения токенов.

Данный подход позволяет избежать деградации моделей, которая часто возникает при использовании стандартных методов дистилляции на больших наборах данных. Переход к анализу расхождений помогает модели лучше справляться со сложными задачами, где требуется не просто имитация стиля, а следование заданному алгоритму мышления, заложенному в учителе.

Ключевые факты

  • Выявлен эффект «вырожденного согласия», при котором модель-студент зацикливается на повторении токенов для формального соответствия учителю.
  • Предложен метод, фокусирующийся на токенах расхождения (mismatch tokens) вместо простого выравнивания вероятностей.
  • Метод позволяет преодолеть проблему потери качества при дистилляции, когда студент формально копирует учителя, но выдает логически неверные ответы.
  • Исследование направлено на улучшение пайплайнов пост-тренинга (post-training) для повышения надежности и логической точности LLM.