Исследователь Пол Шеперд продемонстрировал склонность современных мультимодальных моделей к уверенным галлюцинациям при работе с визуальными данными. В ходе эксперимента ИИ-модель описывала детали изображения, которое технически не было доступно для анализа, демонстрируя «уверенную ложь» и выдумывая объекты, основываясь на контексте диалога, а не на реальных пикселях, что ставит под вопрос надежность визуального ИИ-анализа.

Эксперимент строился на подаче модели изображения, которое было скрыто или недоступно для корректной интерпретации, при этом система продолжала генерировать подробные описания несуществующих элементов. Этот феномен подчеркивает проблему «автозаполнения» в мультимодальных архитектурах, где модель стремится поддержать связность диалога, отдавая приоритет вероятностному тексту перед фактической точностью восприятия входного сигнала.

Подобное поведение указывает на критические уязвимости в системах, полагающихся на ИИ для анализа визуальных данных в реальном времени, таких как системы безопасности, медицинская диагностика или автономные агенты. Модели склонны к конфабуляциям, когда сталкиваются с неоднозначностью, что требует внедрения более строгих механизмов верификации данных и контроля за обоснованностью ответов (grounding) в мультимодальных пайплайнах.

Ключевые факты

  • Эксперимент показал, что ИИ-модели могут генерировать детализированные описания объектов, которых нет на исходном изображении.
  • Модели демонстрируют высокую степень уверенности в своих ответах даже при отсутствии визуальных доказательств.
  • Основной причиной галлюцинаций является приоритет лингвистической вероятности над фактическим анализом визуального контента.
  • Результаты исследования подчеркивают необходимость разработки методов проверки «обоснованности» (grounding) для мультимодальных систем.