Исследователи представили метод MIRROR, направленный на устранение разрыва в логических способностях мультимодальных моделей (VLM). В отличие от LLM, VLM часто демонстрируют нестабильные результаты при работе с визуальными данными, даже если задача имеет текстовый эквивалент. Новый подход обучает модели сопоставлять и интегрировать информацию из различных представлений — текста, диаграмм и их комбинаций — для повышения точности рассуждений.

Проблема заключается в том, что текущие модели часто решают задачу, опираясь только на один тип данных, игнорируя контекст другого. Например, модель может успешно обработать текстовое условие задачи, но провалиться при анализе аналогичной геометрической диаграммы. Метод MIRROR заставляет модель учитывать «другой взгляд» на проблему, что позволяет выравнивать логические цепочки и минимизировать ошибки, возникающие из-за неполного восприятия визуального контента.

Авторы работы показывают, что использование кросс-модального обучения помогает моделям лучше понимать пространственные и геометрические отношения. Это критически важно для задач, где визуальная информация является первичной, но требует логического вывода, характерного для текстовых моделей. Внедрение такого подхода способствует созданию более надежных систем, способных работать с комплексными мультимодальными данными без потери точности при переключении между форматами представления.

Ключевые факты

  • Метод MIRROR направлен на решение проблемы несогласованности ответов VLM при работе с разными представлениями одной задачи.
  • Исследование сфокусировано на геометрических задачах, где визуальные и текстовые данные несут идентичную логическую нагрузку.
  • Подход позволяет модели обучаться на «другом взгляде», что значительно снижает вероятность ошибок при интерпретации диаграмм.
  • Метод демонстрирует, что интеграция различных модальностей повышает общую способность моделей к глубоким визуальным рассуждениям.