Исследователи представили ReflectRL — новый подход к post-training больших языковых моделей, который использует «золотые негативные траектории». В отличие от стандартных методов, отбрасывающих неудачные попытки экспертных моделей, ReflectRL извлекает из них полезный опыт. Система учит модель рефлексировать над ошибками, превращая их в основу для прямого логического вывода и повышения качества рассуждений.

Традиционные методы обучения с подкреплением (on-policy) сильно зависят от качества экспертных данных. Если экспертная модель ошибается на сложных задачах, процесс обучения теряет ориентир. ReflectRL решает эту проблему, интегрируя этап рефлексии: модель анализирует, почему эксперт пришел к неверному ответу, и на основе этого анализа корректирует собственную стратегию решения задачи.

Этот подход позволяет эффективно использовать даже те данные, которые ранее считались «мусорными» или бесполезными для обучения. В результате модель становится более устойчивой к сложным логическим вызовам и демонстрирует лучшие показатели в задачах, требующих многошагового рассуждения, где вероятность ошибки эксперта возрастает.

Ключевые факты

  • ReflectRL внедряет механизм «рефлексивного рассуждения» для обучения моделей на ошибках экспертов.
  • Метод позволяет использовать неудачные траектории экспертных моделей в качестве обучающего сигнала.
  • Подход направлен на повышение производительности в задачах, где экспертные модели часто допускают ошибки.
  • Технология ориентирована на улучшение логических способностей LLM в рамках парадигмы on-policy обучения.