Исследователи представили метод Trajectory-Relayed On-Policy Distillation (TROP), решающий проблему «ошибки префикса» при дистилляции моделей. В традиционных подходах неверный шаг в рассуждениях студента приводит к накоплению ошибок. TROP корректирует этот процесс, используя траектории учителя для перенаправления студента, что повышает надежность обучения и эффективность использования вычислительных ресурсов при генерации длинных последовательностей.

Основная сложность классической дистилляции «на политике» (on-policy distillation) заключается в том, что модель-студент быстро теряет верное направление рассуждений. Если на раннем этапе генерации допущена ошибка, последующие токены лишь закрепляют неверный контекст. Это создает асимметрию между учителем и студентом: учитель всегда следует по оптимальному пути, тогда как студент вынужден пытаться исправить свои отклонения, получая при этом некачественные сигналы для обучения.

Метод TROP вводит механизм «передачи эстафеты», который позволяет студенту возвращаться к корректным траекториям учителя даже после совершения ошибки. Вместо того чтобы продолжать генерацию на основе неверного префикса, система динамически перестраивает процесс обучения, минимизируя потери от неэффективных вычислений и улучшая качество логических цепочек в итоговых ответах модели.

Ключевые факты

  • Метод TROP устраняет проблему накопления ошибок при отклонении студента от верного пути рассуждений.
  • Технология решает проблему асимметрии между учителем и студентом, возникающую при работе с ошибочными префиксами.
  • Подход позволяет значительно сократить объем «бесполезных» вычислений, затрачиваемых на генерацию неверных продолжений текста.
  • Метод ориентирован на улучшение качества обучения моделей в задачах, требующих многошагового логического вывода.