Исследователи представили новый бенчмарк для оценки способности мультимодальных моделей (MLLM) к «активному наблюдению». В отличие от стандартных тестов, анализирующих статические изображения, этот метод проверяет, как модели управляют вниманием и корректируют гипотезы в процессе обработки визуальной информации, имитируя человеческий подход к восприятию, основанный на непрерывном цикле обратной связи и перенаправлении взгляда.
Современные мультимодальные системы часто ограничены анализом «одиночных снимков», что не позволяет им полноценно имитировать когнитивные процессы человека. Авторы работы подчеркивают, что для выполнения сложных задач в динамической среде недостаточно просто распознать объекты на картинке — необходимо уметь активно исследовать пространство, опираясь на промежуточные выводы. Новый тест направлен на выявление пробелов в архитектурах, которые не учитывают этот «замкнутый цикл» взаимодействия с визуальными данными.
Разработка призвана изменить подход к тестированию ИИ, смещая фокус с пассивного распознавания на активное поведение. Это критически важно для развития автономных агентов и робототехники, где способность модели самостоятельно определять, куда «направить взгляд» для получения недостающей информации, является ключевым фактором успеха в реальных условиях.
Ключевые факты
- Бенчмарк оценивает способность моделей к активному наблюдению, имитирующему человеческий когнитивный процесс.
- Исследование опирается на десятилетия данных из области психофизики и когнитивных наук о природе зрения.
- Тест выявляет неспособность большинства текущих MLLM эффективно управлять вниманием в динамических задачах.
- Методология фокусируется на переходе от анализа статических изображений к активному циклу формирования гипотез.