Эксперимент показал, что мультимодальные модели (VLM) склонны к значительным ошибкам при оценке стоимости объектов, основываясь на контексте изображения. При оценке одного и того же ожерелья стоимостью $2.43, надетого на разные образы, модели выдавали прогнозы от $19 до $104. Результаты демонстрируют наличие «эффекта ореола» и предвзятость алгоритмов при визуальной оценке товаров.

Исследователь протестировал популярные модели, включая GPT-4o и Claude 3.5 Sonnet, используя одни и те же вводные данные. Выяснилось, что модели приписывают более высокую стоимость аксессуарам, если они представлены в более «премиальном» или стилизованном окружении. Это указывает на то, что ИИ-системы опираются не на объективные характеристики предмета, а на ассоциативные связи, заложенные в их обучающей выборке.

Такая непредсказуемость оценок ставит под сомнение надежность использования текущих VLM в задачах автоматизированной оценки стоимости (appraisal), страхования или динамического ценообразования в e-commerce. Без дополнительной калибровки или специализированных инструментов для анализа атрибутов, модели склонны к галлюцинациям в вопросах рыночной стоимости, подвергаясь влиянию визуального контекста.

Ключевые факты

  • Реальная стоимость ожерелья, использованного в тесте, составила $2.43.
  • ИИ-модели оценили один и тот же объект в диапазоне от $19 до $104 в зависимости от фона.
  • В эксперименте проверялась устойчивость моделей к «эффекту ореола» при визуальном анализе.
  • Результаты подчеркивают риск использования VLM для автоматической оценки активов без верификации.