Исследователи представили FriendBench — специализированный бенчмарк для проверки способности ИИ-моделей определять степень знакомства между людьми на основе анализа их поведения. Тестирование проводится на 20-секундных видеофрагментах диалогов, где содержание речи идентично для всех пар, что вынуждает модели опираться исключительно на невербальные сигналы, интонации и динамику взаимодействия для оценки социального контекста.

Способность считывать социальные нюансы является критическим барьером для создания по-настоящему эмпатичных и адаптивных ИИ-агентов. В отличие от стандартных тестов на понимание текста, FriendBench фокусируется на «диадической близости» — способности распознать, являются ли собеседники давними знакомыми или встретились впервые. Это требует от нейросетей глубокой интеграции аудиовизуальных данных и понимания тонких поведенческих паттернов, которые часто игнорируются при обучении на больших текстовых корпусах.

В рамках исследования было протестировано 26 различных моделей, включая современные мультимодальные системы. Результаты показывают значительный разрыв между человеческим восприятием и способностями ИИ в задачах социального анализа. Бенчмарк позволяет количественно измерить, насколько эффективно модели улавливают социальную динамику, что открывает путь к созданию более естественных интерфейсов взаимодействия, способных адекватно реагировать на эмоциональный фон и историю отношений между пользователями.

Ключевые факты

  • FriendBench оценивает способность ИИ определять знакомство людей по 20-секундным видеороликам.
  • В исследовании приняли участие 26 различных мультимодальных моделей.
  • Основной упор сделан на анализ невербальных сигналов, так как текстовое содержание диалогов во всех тестах идентично.
  • Бенчмарк направлен на устранение пробелов в оценке социального интеллекта и эмпатии современных нейросетей.