Исследователи представили метод борьбы с искажениями при обучении моделей методом On-policy distillation (OPD). В традиционных подходах студент обучается на собственных траекториях, используя вероятности токенов от учителя. Авторы доказали, что локальная интерпретация этих вероятностей ошибочна, так как она сильно зависит от итогового результата всей траектории, что приводит к некорректному обучению на ошибках.

Проблема заключается в том, что при оценке действий модели на конкретном шаге учитель часто опирается на конечный исход последовательности. Это создает «искажение результатом» (outcome-confounding), из-за чего модель-студент не может адекватно отличить случайную удачу от правильной стратегии. В результате обучение становится менее стабильным, а модель хуже обобщает полученные знания.

Для решения этой задачи предложен новый подход к локальному надзору, который позволяет эффективно разделять влияние локальных действий и глобального результата траектории. Это позволяет студенту лучше имитировать поведение учителя, избегая слепого копирования действий, которые привели к успеху лишь благодаря стечению обстоятельств, а не качеству принятого решения.

Ключевые факты

  • Метод On-policy distillation (OPD) предполагает обучение студента на траекториях, сгенерированных им самим, с использованием вероятностей от учителя.
  • Выявлено, что локальные оценки вероятностей токенов подвержены влиянию результата всей траектории, что искажает процесс обучения.
  • Предложенный подход позволяет корректировать обучение, исключая влияние «искажения результатом» при оценке действий модели.
  • Исследование направлено на повышение качества дистилляции моделей, что критически важно для эффективного переноса знаний от крупных моделей к более компактным.