Исследователи представили метод OPD-V (Visual On-Policy Self-Distillation), направленный на улучшение визуального мышления мультимодальных больших языковых моделей (MLLM). Новый подход решает проблему дисбаланса модальностей, возникающую при обучении, когда текстовая информация доминирует над визуальной. Техника позволяет моделям эффективнее интегрировать данные из разных источников, повышая точность рассуждений при анализе изображений и видео в процессе самодистилляции.

Традиционные методы обучения часто игнорируют тот факт, что модели склонны полагаться на текстовые признаки, игнорируя визуальные детали. OPD-V корректирует этот процесс, обеспечивая баланс между модальностями. Это позволяет модели лучше «видеть» контекст изображения, не переключаясь на простые текстовые ассоциации, что критически важно для задач визуального вопросно-ответного анализа и интерпретации сложных визуальных сцен.

Результаты экспериментов показывают, что предложенный подход значительно улучшает показатели моделей в бенчмарках, требующих глубокого понимания визуальных данных. Метод демонстрирует стабильность при масштабировании и может быть интегрирован в существующие пайплайны пост-тренировки MLLM для повышения их способности к логическим выводам на основе мультимодальных входных данных.

Ключевые факты

  • Метод OPD-V фокусируется на устранении дисбаланса модальностей (Modality Imbalance) в мультимодальных моделях.
  • Подход использует технику On-Policy Self-Distillation для улучшения визуального мышления.
  • Решение предотвращает чрезмерную зависимость модели от текстовых данных при генерации ответов на визуальные стимулы.
  • Метод оптимизирует процесс обучения, позволяя модели более эффективно извлекать информацию из визуальных признаков.