Исследователи представили MeetingToM — специализированный бенчмарк для оценки способности мультимодальных LLM понимать теорию разума (ToM) в контексте многосторонних встреч. В отличие от существующих тестов, сфокусированных на простых видео, этот инструмент проверяет навыки моделей по интерпретации намерений, убеждений и знаний участников на основе распределенных аудиовизуальных сигналов, что критически важно для качественного анализа корпоративных коммуникаций.

Теория разума остается одной из сложнейших задач для современных нейросетей, так как требует не только распознавания речи, но и анализа невербального поведения, контекста диалога и динамики взаимодействия между несколькими людьми. MeetingToM моделирует реальные сценарии встреч, где информация о состоянии собеседника скрыта в нюансах мимики, жестов и интонаций, которые часто игнорируются стандартными моделями при обработке длинных видеопотоков.

Разработка этого бенчмарка направлена на устранение разрыва между способностью ИИ к транскрибированию текста и реальным социальным интеллектом. Авторы подчеркивают, что текущие мультимодальные модели часто демонстрируют высокие показатели в задачах на описание объектов, но проваливаются при попытке предсказать скрытые мотивы или эмоциональные состояния участников дискуссии, что ограничивает их применение в качестве полноценных бизнес-ассистентов.

Ключевые факты

  • MeetingToM оценивает способность моделей выявлять намерения и убеждения участников в многосторонних диалогах.
  • Бенчмарк использует комплексные аудиовизуальные данные, имитирующие реальные рабочие совещания.
  • Основная сложность теста заключается в необходимости сопоставления вербальных высказываний с невербальными сигналами поведения.
  • Исследование показывает, что современные мультимодальные LLM испытывают трудности с интерпретацией контекстуальных социальных сигналов, распределенных между несколькими спикерами.