Исследователи представили метод Fusion Training, позволяющий объединить в одной языковой модели два режима работы: быстрые краткие ответы и глубокое пошаговое рассуждение. Авторы систематизировали динамику обучения, определив оптимальные соотношения данных и графики тренировки, что значительно повышает точность моделей при решении сложных математических задач и улучшает их способность к обобщению.
Традиционные подходы часто разделяют модели на специализированные «думающие» системы и быстрые чат-боты. Новый метод предлагает унифицированный подход, при котором модель учится переключаться между режимами в зависимости от сложности запроса. Это позволяет сохранить эффективность инференса для простых задач, не жертвуя качеством логических цепочек в математических вычислениях.
В работе анализируется влияние различных стратегий смешивания данных на итоговую производительность. Исследование показывает, что правильная настройка процесса обучения позволяет модели лучше справляться с задачами, требующими многоступенчатого вывода, сохраняя при этом лаконичность в стандартных диалогах. Полученные результаты дают практические рекомендации для разработчиков, стремящихся сбалансировать скорость и точность моделей.
Ключевые факты
- Метод Thinking Mode Fusion (TMF) объединяет режимы «быстрого ответа» и «глубокого рассуждения» в рамках архитектуры одной модели.
- Исследование сфокусировано на оптимизации параметров обучения, включая соотношение данных и графики (training schedule) для каждого режима.
- Метод направлен на устранение разрыва между эффективностью инференса и способностью модели к сложным математическим вычислениям.
- Работа базируется на систематическом анализе динамики обучения, что позволяет улучшить обобщающую способность LLM при работе с математическим контентом.