Исследователи представили метод автоматизированного упорядочивания задач для обучения моделей с несколькими политиками (Multi-Policy LLMs). Подход решает проблему интерференции при использовании единых LoRA-адаптеров, позволяя эффективно адаптировать модели к разнородным наборам данных без катастрофического забывания. Технология оптимизирует процесс дообучения, обеспечивая лучшее качество переноса знаний между различными задачами по сравнению с традиционными методами PEFT.

Традиционные подходы к Parameter-Efficient Fine-Tuning (PEFT) часто полагаются на общий низкоранговый адаптер, что приводит к конфликтам при попытке обучить модель на последовательности разноплановых задач. Когда модель пытается выучить новую задачу, она неизбежно «затирает» веса, отвечающие за предыдущие навыки. Новое решение предлагает динамически определять порядок подачи данных, минимизируя негативное влияние между задачами.

Авторы метода фокусируются на структурировании обучающей выборки таким образом, чтобы градиентные обновления от разных задач не вступали в противоречие. Это позволяет сохранять высокую точность на широком спектре навыков даже при ограниченном количестве обучаемых параметров. Подход демонстрирует значительный потенциал для создания универсальных моделей, способных к последовательному обучению без необходимости полного переобучения всей архитектуры.

Ключевые факты

  • Метод направлен на устранение интерференции при использовании единых LoRA-адаптеров в процессе дообучения.
  • Решение предотвращает эффект катастрофического забывания при работе с гетерогенными последовательностями задач.
  • Автоматизированная стратегия упорядочивания задач повышает эффективность переноса знаний (transfer learning) между различными доменами.
  • Исследование предлагает альтернативу увеличению количества параметров или сложной композиции множества адаптеров для улучшения выразительности модели.