Исследователи обнаружили, что мультимодальные модели демонстрируют разную точность в зависимости от последовательности подачи данных: обработка изображения перед текстовым вопросом стабильно дает лучшие результаты, чем обратный порядок. Для устранения этой семантически нерелевантной чувствительности предложен новый метод обучения на этапе тестирования (Test-Time Training), который нормализует ответы модели независимо от структуры промпта.

Данная особенность, названная «ошибкой порядка модальностей», была выявлена при анализе трех популярных архитектур на трех различных бенчмарках. Разрыв в производительности между «изображением-первым» и «вопросом-первым» оказался статистически значимым, что указывает на фундаментальный пробел в том, как модели связывают визуальные и текстовые токены в процессе инференса.

Предложенный метод Test-Time Training позволяет адаптировать модель к конкретному запросу в режиме реального времени, минимизируя влияние порядка ввода без необходимости полноценного дообучения всей нейросети. Это повышает надежность систем компьютерного зрения и обработки естественного языка, делая их менее зависимыми от специфики формирования промптов пользователем или разработчиком.

Ключевые факты

  • Выявлена систематическая чувствительность моделей к порядку подачи модальностей: подача изображения перед текстом повышает точность ответов.
  • Проблема подтверждена на трех различных архитектурах моделей и трех стандартных бенчмарках для оценки мультимодальных систем.
  • Новый метод Test-Time Training корректирует поведение модели непосредственно в момент выполнения запроса, обеспечивая согласованность результатов.
  • Технология позволяет снизить зависимость качества ответов от структуры промпта без изменения весов основной модели.