Исследователи проанализировали способность мультимодальных моделей (VLM) принимать решения на основе визуальных данных в задачах управления. Выяснилось, что высокие показатели успеха в симуляторах часто достигаются не за счет анализа изображения, а благодаря предсказаниям на основе динамики среды и консервативных априорных действий. Модели часто игнорируют визуальный контекст, полагаясь на статистические закономерности.

В рамках работы авторы применили серию тестов с абляцией входных данных, включая использование «слепых» контроллеров, подачу идентичных повторяющихся кадров и манипуляции с осями движения. Результаты показывают, что текущие методы оценки «zero-shot» контроллеров могут быть обманчивы, так как агент может успешно завершать траектории даже при отсутствии значимой визуальной информации, опираясь исключительно на внутренние предубеждения модели.

Эта проблема ставит под сомнение надежность использования VLM в реальных робототехнических системах, где критически важно понимание динамически меняющейся обстановки. Без явной привязки действий к визуальным признакам (visual grounding) модели остаются подвержены ошибкам в непредсказуемых сценариях, где полагаться на «средние» стратегии поведения небезопасно.

Ключевые факты

  • Исследование выявило, что VLM-агенты часто показывают высокую эффективность в симуляторах, игнорируя реальные визуальные входные данные.
  • Основным фактором успеха в тестах оказались консервативные априорные действия и предсказуемая динамика симулятора, а не анализ картинки.
  • Авторы предложили методологию «input-ablation» для проверки того, действительно ли модель использует визуальный ввод для принятия решений.
  • Работа подчеркивает необходимость разработки новых метрик оценки для VLM, которые отличают реальное восприятие от статистического угадывания.