Исследователи представили методологию Visual Credit Audit (VCA), предназначенную для оценки того, насколько мультимодальные модели действительно опираются на визуальные данные при решении пространственных задач. Новый подход позволяет отделить реальное использование изображений от случайных угадываний или работы на основе одних лишь текстовых подсказок, что критически важно для объективной оценки способностей современных ИИ-систем.
Существующие бенчмарки часто используют закрытые вопросы с выбором ответа, где модель может дать верный результат, даже если изображение не несет полезной информации. VCA вводит систему контроля, сравнивая ответы модели в трех сценариях: с исходным изображением, с текстовым описанием без картинки и с пустым контекстом. Это позволяет статистически подтвердить, получает ли модель дополнительную поддержку от визуальных данных и реагирует ли она на конкретные пространственные отношения, представленные в кадре.
Применение данного метода выявляет скрытые недостатки в текущих мультимодальных моделях, которые зачастую демонстрируют высокие показатели в тестах, не обладая при этом глубоким пониманием визуального пространства. Разработка VCA направлена на создание более надежных инструментов тестирования, которые исключают возможность «подглядывания» в ответы за счет статистических артефактов или избыточных текстовых подсказок, сопровождающих визуальные задания.
Ключевые факты
- Метод Visual Credit Audit (VCA) разделяет оценку на два параметра: поддержку решения визуальными данными и реакцию на конкретные пространственные отношения.
- VCA использует контрольные группы с «пустыми» данными и только текстовыми описаниями для выявления истинной зависимости модели от изображения.
- Исследование направлено на устранение проблемы «ложных успехов» в мультимодальных бенчмарках, где правильный ответ не подтверждается визуальным контекстом.
- Методология позволяет количественно измерить вклад визуальной составляющей в итоговую точность модели при выполнении задач на пространственное мышление.