Исследователи представили новый подход к пост-тренингу больших языковых моделей, основанный на методе on-policy самодистилляции (OPSD). В отличие от существующих техник, этот метод полностью исключает необходимость во внешних сигналах, таких как эталонные ответы, отзывы среды или подсказки от более мощных моделей, позволяя модели обучаться исключительно на собственных внутренних данных.

Традиционные методы дистилляции часто зависят от «учителя» или размеченных наборов данных, что ограничивает их автономность и масштабируемость. Предложенный подход доказывает, что модель способна эффективно улучшать свои способности, анализируя и фильтруя собственные выходы в процессе генерации. Это открывает путь к созданию более независимых систем, способных к самосовершенствованию без привлечения дорогостоящих человеческих ресурсов или сложных внешних инфраструктур для оценки качества ответов.

Авторы работы демонстрируют, что исключение внешних зависимостей не только упрощает процесс дообучения, но и позволяет избежать накопления ошибок, характерных для методов, использующих предвзятые или неполные внешние сигналы. Техника фокусируется на оптимизации вероятностного распределения ответов самой модели, что делает процесс обучения более стабильным и эффективным в условиях ограниченного доступа к качественным обучающим выборкам.

Ключевые факты

  • Метод OPSD (On-policy Self-Distillation) позволяет проводить пост-тренинг LLM без использования ground-truth сигналов.
  • Исключена необходимость в сторонних моделях-учителях или внешних системах вознаграждения (reward models).
  • Подход направлен на повышение автономности моделей при дообучении на собственных генерациях.
  • Исследование опубликовано на платформе arXiv и предлагает альтернативу классическим методам обучения с подкреплением (RLHF).