Исследователи проанализировали парадигму «мышления с изображениями», при которой мультимодальные модели используют активные визуальные операции вроде кадрирования или масштабирования. Выяснилось, что такие методы часто не дают прироста точности по сравнению с прямым инференсом, при этом значительно увеличивая затраты токенов и вычислительную нагрузку, а иногда даже снижая качество ответов из-за ошибок в выборе областей для анализа.

Авторы работы провели причинно-следственный аудит, чтобы понять, действительно ли модели «думают» с помощью инструментов или просто имитируют процесс. Оказалось, что модели склонны многократно обрабатывать нерелевантные фрагменты изображений, игнорируя важные детали. В ряде случаев прямая подача исходного изображения в модель показывает лучшие результаты, чем попытки системы самостоятельно «нарезать» визуальные данные для анализа.

Результаты указывают на то, что текущие подходы к агентному взаимодействию с визуальным контентом требуют пересмотра. Вместо автоматизированных операций, которые потребляют дополнительные ресурсы, разработчикам стоит сосредоточиться на улучшении базовых способностей моделей к восприятию цельных изображений, так как избыточное использование инструментов часто становится «иллюзией» полезной деятельности, не приносящей практической пользы.

Ключевые факты

  • Активные визуальные операции (crop-and-zoom) в мультимодальных моделях часто приводят к маргинальным или отрицательным результатам.
  • Использование инструментов для обработки изображений существенно увеличивает стоимость инференса из-за роста потребления токенов.
  • Модели часто совершают ошибки, фокусируясь на нерелевантных регионах изображения, которые не несут полезной информации для ответа.
  • Прямой инференс без вспомогательных визуальных манипуляций в ряде тестов демонстрирует более высокую точность и надежность.
  • Исследование ставит под сомнение эффективность текущих агентных паттернов для визуального анализа в LLM.