Исследователи представили метод Adaptive FastOPD, оптимизирующий процесс on-policy дистилляции (OPD) в обучении языковых моделей. Технология динамически регулирует горизонт развертывания (rollout horizon) в зависимости от прогресса обучения, что позволяет сократить вычислительные затраты, возникающие из-за неравномерной длины ответов модели, и повысить эффективность использования ресурсов при сохранении качества supervision от учительской модели.

Традиционные подходы к OPD часто страдают от неэффективности: процесс обучения простаивает в ожидании завершения генерации длинных последовательностей, что создает «узкие места» при формировании батчей. Существующие методы ускорения, опирающиеся на фиксированные бюджеты или жесткие пороги согласованности между учителем и учеником, часто не учитывают реальную динамику обучения и текущую сложность задач.

Adaptive FastOPD вводит механизм адаптивного расширения горизонта, который анализирует состояние обучения в реальном времени. Это позволяет системе гибко переключаться между короткими и длинными траекториями, минимизируя избыточные вычисления там, где модель уже достигла достаточной уверенности, и фокусируя ресурсы на сложных участках обучения. Такой подход значительно снижает общее время тренировки без потери точности аппроксимации.

Ключевые факты

  • Метод Adaptive FastOPD оптимизирует on-policy дистилляцию за счет динамического управления горизонтом развертывания.
  • Технология решает проблему вычислительных задержек, вызванных вариативностью длины ответов в обучающих выборках.
  • Алгоритм адаптирует параметры обучения на основе текущего прогресса модели, а не фиксированных порогов.
  • Подход позволяет сократить время обучения за счет более эффективного формирования батчей и снижения избыточных вычислений.