Исследователи проанализировали эффективность слияния моделей (model merging) как альтернативы совместному обучению (multi-task learning) в задачах обучения с подкреплением. Авторы провели прямое сравнение, обучив специализированные агенты Qwen3-8B на разных уровнях сложности, и оценили, насколько метод «векторов задач» (task vectors) способен заменить полноценное обучение на объединенных данных, выявив геометрические закономерности в пространстве весов.
Метод слияния моделей часто позиционируется как способ объединения навыков без доступа к исходным наборам данных или вычислительным мощностям для совместного обучения. Однако в области обучения с подкреплением подобные сравнения ранее практически не проводились. Работа заполняет этот пробел, демонстрируя, что слияние весов может достигать результатов, сопоставимых с обучением на мультизадачных наборах данных, если учитывать геометрические свойства векторов задач.
Исследование опирается на анализ того, как именно веса моделей распределяются в многомерном пространстве при решении задач разной сложности. Авторы показывают, что при правильном подходе к слиянию можно избежать деградации производительности, характерной для простых методов усреднения весов, что открывает новые возможности для создания универсальных агентов без необходимости переобучения с нуля.
Ключевые факты
- В качестве базовой архитектуры для экспериментов использовалась модель Qwen3-8B.
- Исследование сфокусировано на сравнении производительности слияния моделей и совместного обучения (joint multi-task training).
- Авторы проанализировали геометрические свойства векторов задач (task vectors) для оценки эффективности их комбинации.
- Работа доказывает, что слияние моделей является жизнеспособной альтернативой в условиях ограниченного доступа к данным для совместного обучения.