Исследователи представили метод RP-OPSD (Reasoning-Pivot-Guided On-Policy Self-Distillation), направленный на улучшение логического мышления больших языковых моделей в мультиязычных сценариях. Подход фокусируется на передаче навыков рассуждения из моделей, обученных на высокоресурсных языках, в модели, работающие с менее распространенными языками, за счет оптимизации процесса самодистилляции и выделения критически важных логических сигналов в процессе генерации.

Традиционные методы самодистилляции часто сталкиваются с проблемой «шумного» обучения, когда модель пытается имитировать все токены сгенерированного ответа, включая нерелевантные или ошибочные промежуточные шаги. Новый метод вводит механизм «логического якоря» (reasoning-pivot), который направляет процесс обучения на наиболее значимые этапы рассуждения. Это позволяет студенческой модели эффективнее перенимать структуру логических цепочек, игнорируя второстепенные детали, что критически важно для сохранения точности при смене языка.

Эксперименты показывают, что использование RP-OPSD значительно повышает производительность моделей в задачах, требующих многошаговых рассуждений на языках с ограниченным объемом обучающих данных. Метод демонстрирует более высокую стабильность обучения по сравнению со стандартными подходами on-policy, сокращая разрыв в качестве между англоязычными моделями и их мультиязычными аналогами.

Ключевые факты

  • Метод RP-OPSD использует механизм «логического якоря» для фильтрации наиболее важных токенов рассуждения при самодистилляции.
  • Подход решает проблему неэффективного переноса логических способностей в мультиязычных LLM, где данные для обучения ограничены.
  • Техника обеспечивает плотный контроль на уровне токенов, что позволяет модели-студенту быстрее усваивать структуру логических цепочек.
  • Исследование направлено на преодоление барьера производительности моделей при работе с низкоресурсными языками в задачах, требующих глубокого анализа.