Исследователи представили метод Dual-Channel Risk-Aware Reinforcement Fine-Tuning (DCR-RFT), направленный на решение проблемы катастрофического забывания при непрерывном дообучении мультимодальных LLM. В условиях значительных сдвигов в распределении задач стандартные алгоритмы обучения с подкреплением теряют стабильность из-за неконтролируемой дисперсии наград. Новый подход разделяет каналы оптимизации, позволяя эффективно сохранять накопленные знания при освоении новых навыков.

Традиционные методы обучения с подкреплением (RFT) при дообучении моделей часто сталкиваются с деградацией производительности на предыдущих этапах обучения. Авторы работы установили, что неявная регуляризация дисперсии наград в классических алгоритмах оказывается недостаточной, когда модель сталкивается с принципиально новыми типами данных. DCR-RFT вводит механизм оценки рисков, который динамически адаптирует процесс обновления весов, минимизируя негативное влияние новых данных на уже выученные представления.

Предложенная архитектура позволяет гибко балансировать между адаптацией к новым задачам и удержанием стабильности параметров. Это критически важно для создания мультимодальных систем, которые должны постоянно обновляться без необходимости полного переобучения на всем массиве исторических данных, что существенно снижает вычислительные затраты и время на итерации при дообучении моделей на новых доменах.

Ключевые факты

  • Метод DCR-RFT разделяет каналы оптимизации для контроля рисков при обучении.
  • Алгоритм направлен на устранение катастрофического забывания при сдвигах в распределении задач.
  • Исследование сфокусировано на непрерывном пост-обучении мультимодальных больших языковых моделей.
  • Механизм позволяет подавлять избыточную дисперсию наград, которая ранее приводила к деградации весов модели.