Исследователи проанализировали взаимосвязь между этапами предобучения и последующего обучения с подкреплением (RL) в больших языковых моделях. Работа раскрывает, как выбор данных и архитектурные параметры предобучения определяют отдачу от вычислительных ресурсов, затраченных на RL, и объясняет фундаментальные изменения в логических способностях моделей, происходящие в процессе пост-тренинга для улучшения навыков рассуждения.

Авторы работы исследуют, почему некоторые модели показывают лучшие результаты при использовании методов RL, чем другие, несмотря на схожие размеры. Основное внимание уделено тому, как именно RL меняет внутренние механизмы модели: происходит ли «обучение новым знаниям» или же модель просто учится эффективнее извлекать уже имеющиеся в весах закономерности. Результаты показывают, что качество и разнообразие данных на этапе предобучения критически важны для того, чтобы RL-алгоритмы могли успешно оптимизировать логические цепочки.

Исследование также затрагивает вопрос масштабируемости: при увеличении вычислительного бюджета на RL-фазу модели, прошедшие специфические этапы предобучения, демонстрируют более стабильный рост производительности. Это позволяет точнее прогнозировать эффективность дообучения на основе характеристик базовой модели, что помогает оптимизировать ресурсы при создании специализированных систем для сложных когнитивных задач.

Ключевые факты

  • Исследование фокусируется на неизученной ранее связи между параметрами предобучения и эффективностью RL-посттренинга.
  • Установлено, что выбор данных на этапе предобучения напрямую определяет «потолок» производительности, достижимый через RL.
  • Работа объясняет, как RL-алгоритмы трансформируют логические способности моделей, разделяя процесс на извлечение знаний и развитие навыков рассуждения.
  • Результаты помогают оптимизировать распределение вычислительных мощностей между этапами предобучения и дообучения для достижения максимальной точности в задачах рассуждения.