Исследователи представили метод Off-Context GRPO, решающий проблему «нулевого сигнала» при обучении моделей с подкреплением (RLVR). В сложных задачах, где модель не может найти верный ответ, стандартные алгоритмы перестают обучаться. Новый подход использует привилегированную информацию, такую как префиксы решений, для направления процесса обучения и преодоления барьера сложности в задачах с верифицируемыми результатами.

Традиционные методы обучения с подкреплением на основе верифицируемых наград (RLVR) сталкиваются с «обрывом обучения»: если модель не способна сгенерировать хотя бы один правильный шаг, она не получает обратной связи для корректировки весов. Это делает невозможным прогресс в задачах, требующих многошаговых логических рассуждений, где вероятность случайного нахождения верного решения крайне мала.

Авторы предлагают использовать дополнительные данные, доступные только на этапе обучения, чтобы направлять генерацию модели в сторону правильного пути. Метод Off-Context GRPO позволяет эффективно использовать эти подсказки, не требуя их наличия при инференсе. Это позволяет моделям успешно решать задачи, которые ранее считались недоступными для обучения через стандартный RLVR, значительно повышая качество логического вывода в математических и программных дисциплинах.

Ключевые факты

  • Метод решает проблему отсутствия обучающего сигнала в задачах с верифицируемыми наградами (RLVR).
  • Использование привилегированной информации (префиксов решений) позволяет модели преодолеть «обучающий обрыв».
  • Подход адаптирует алгоритм GRPO для интеграции внешних подсказок без необходимости их использования в финальной версии модели.
  • Техника ориентирована на повышение точности рассуждений в сложных задачах, где случайный поиск решения неэффективен.