Эксперимент показал, что мультимодальные модели (VLM) склонны к значительным ошибкам при оценке стоимости объектов, основываясь на контексте изображения. При оценке одного и того же ожерелья стоимостью $2.43, надетого на разные образы, модели выдавали прогнозы от $19 до $104. Результаты демонстрируют наличие «эффекта ореола» и предвзятость алгоритмов при визуальной оценке товаров.
Исследователь протестировал популярные модели, включая GPT-4o и Claude 3.5 Sonnet, используя одни и те же вводные данные. Выяснилось, что модели приписывают более высокую стоимость аксессуарам, если они представлены в более «премиальном» или стилизованном окружении. Это указывает на то, что ИИ-системы опираются не на объективные характеристики предмета, а на ассоциативные связи, заложенные в их обучающей выборке.
Такая непредсказуемость оценок ставит под сомнение надежность использования текущих VLM в задачах автоматизированной оценки стоимости (appraisal), страхования или динамического ценообразования в e-commerce. Без дополнительной калибровки или специализированных инструментов для анализа атрибутов, модели склонны к галлюцинациям в вопросах рыночной стоимости, подвергаясь влиянию визуального контекста.
Ключевые факты
- Реальная стоимость ожерелья, использованного в тесте, составила $2.43.
- ИИ-модели оценили один и тот же объект в диапазоне от $19 до $104 в зависимости от фона.
- В эксперименте проверялась устойчивость моделей к «эффекту ореола» при визуальном анализе.
- Результаты подчеркивают риск использования VLM для автоматической оценки активов без верификации.