Исследователи представили SocietyBench — новый бенчмарк для оценки способности больших языковых моделей прогнозировать развитие сложных социальных событий. В отличие от существующих тестов, сфокусированных на выполнении технических задач, этот инструмент измеряет понимание причинно-следственных связей в социуме, позволяя анализировать, как модели предсказывают последствия гипотетических изменений в реальных мировых сценариях и социальных процессах.

Современные агентные системы часто тестируются на узких навыках, таких как написание кода или навигация по интерфейсам, однако их способность моделировать социальную динамику оставалась вне поля зрения разработчиков. SocietyBench заполняет этот пробел, предлагая структурированный подход к оценке «социального интеллекта» ИИ. Система принимает на вход описание события и требует от модели спрогнозировать цепочку последующих социальных реакций и изменений в обществе.

Использование данного бенчмарка позволяет глубже понять ограничения моделей в контексте долгосрочного планирования и понимания человеческого поведения. Это критически важно для создания агентов, которые взаимодействуют с людьми или работают в средах, где социальный контекст определяет успех выполнения задачи. Тест помогает выявить, насколько точно нейросети улавливают нюансы общественных отношений и предсказывают реакцию социума на различные стимулы.

Ключевые факты

  • SocietyBench оценивает способность ИИ к прогнозированию контрфактических сценариев развития общества.
  • Бенчмарк фокусируется на социальных навыках, которые ранее не учитывались в стандартных тестах на производительность.
  • Система использует однострочные описания событий в качестве отправной точки для генерации долгосрочных социальных прогнозов.
  • Инструмент направлен на развитие более глубокого понимания причинно-следственных связей в социальных системах у LLM.