Исследователи представили метод Progressive Multimodal Alignment (PMA), направленный на борьбу с «забыванием» в мультимодальных языковых моделях (MLLM) при непрерывном обучении. Технология предотвращает деградацию визуального проектора, который отвечает за связку визуальных данных с текстовым пространством, обеспечивая стабильность работы модели при последовательном освоении новых задач и изменении распределений данных.

В процессе непрерывного обучения (Continual Instruction Tuning) мультимодальные модели часто сталкиваются с проблемой дрейфа весов проектора. Это приводит к тому, что модель теряет способность корректно интерпретировать визуальные признаки, полученные на ранних этапах обучения. Авторы работы предлагают архитектурный подход, позволяющий сохранять накопленные знания о визуальных представлениях без необходимости хранения огромных наборов данных из прошлых итераций.

Метод PMA фокусируется на постепенной адаптации проектора к новым инструкциям, минимизируя конфликт между старыми и новыми знаниями. Это позволяет эффективно обновлять модели для работы с новыми типами визуального контента, сохраняя при этом общую производительность системы на прежнем уровне. Решение особенно актуально для сценариев, где требуется регулярное дообучение моделей на актуальных данных без риска катастрофического забывания.

Ключевые факты

  • Метод Progressive Multimodal Alignment (PMA) решает проблему «проекторного забывания» (projector-level forgetting) в MLLM.
  • Основная причина деградации моделей — дрейф визуального проектора при смене распределений данных и семантики инструкций.
  • Технология позволяет поддерживать стабильность кросс-модального понимания при непрерывном обучении без необходимости переобучения на полных исторических датасетах.
  • Исследование сфокусировано на оптимизации взаимодействия между визуальными эмбеддингами и языковым пространством в условиях динамически меняющихся задач.