Исследователи проанализировали использование LLM в качестве синтетических участников социологических опросов и экономических экспериментов. На примере панели из 16 конфигураций GPT-4.1 в стратегических играх выяснилось, что модели успешно проходят базовые проверки на соответствие человеческим данным, однако их ответы могут быть неточными при оценке специфических причинно-следственных связей и реакций на внешние воздействия.

Авторы работы сосредоточились на проверке того, могут ли «персонализированные» настройки моделей имитировать поведение реальных людей в повторяющихся игровых сценариях. Хотя модели продемонстрировали способность соответствовать общим статистическим критериям, заложенным в дизайн исследования, они показали ограниченную точность при попытке оценить индивидуальные различия в откликах на разные условия эксперимента. Это ставит под вопрос использование стандартных ИИ-панелей для глубокого анализа поведенческих паттернов.

Результаты указывают на риск «ложного соответствия», когда модель проходит формальные тесты на схожесть с человеческой выборкой, но не отражает реальную динамику принятия решений. Исследование подчеркивает необходимость разработки более строгих методов валидации синтетических участников, чтобы избежать искажений в результатах социальных и маркетинговых исследований, где точность оценки реакции аудитории критически важна для принятия бизнес-решений.

Ключевые факты

  • В эксперименте использовалась фиксированная панель из 16 облегченных конфигураций GPT-4.1, настроенных под разные типы личностей.
  • Модели участвовали в серии повторяющихся стратегических игр для проверки их способности имитировать человеческое поведение.
  • Панель успешно прошла проверку на соответствие средним значениям контрольных групп в трех из четырех игровых сценариев.
  • Выявлена неспособность моделей точно оценивать индивидуальные различия в откликах на специфические воздействия (imprecise treatment-response estimates).
  • Работа ставит под сомнение надежность текущих методов валидации ИИ-агентов как полноценных заменителей человеческих респондентов в научных и рыночных исследованиях.