Исследователи проанализировали использование LLM в качестве синтетических участников социологических опросов и экономических экспериментов. На примере панели из 16 конфигураций GPT-4.1 в стратегических играх выяснилось, что модели успешно проходят базовые проверки на соответствие человеческим данным, однако их ответы могут быть неточными при оценке специфических причинно-следственных связей и реакций на внешние воздействия.
Авторы работы сосредоточились на проверке того, могут ли «персонализированные» настройки моделей имитировать поведение реальных людей в повторяющихся игровых сценариях. Хотя модели продемонстрировали способность соответствовать общим статистическим критериям, заложенным в дизайн исследования, они показали ограниченную точность при попытке оценить индивидуальные различия в откликах на разные условия эксперимента. Это ставит под вопрос использование стандартных ИИ-панелей для глубокого анализа поведенческих паттернов.
Результаты указывают на риск «ложного соответствия», когда модель проходит формальные тесты на схожесть с человеческой выборкой, но не отражает реальную динамику принятия решений. Исследование подчеркивает необходимость разработки более строгих методов валидации синтетических участников, чтобы избежать искажений в результатах социальных и маркетинговых исследований, где точность оценки реакции аудитории критически важна для принятия бизнес-решений.
Ключевые факты
- В эксперименте использовалась фиксированная панель из 16 облегченных конфигураций GPT-4.1, настроенных под разные типы личностей.
- Модели участвовали в серии повторяющихся стратегических игр для проверки их способности имитировать человеческое поведение.
- Панель успешно прошла проверку на соответствие средним значениям контрольных групп в трех из четырех игровых сценариев.
- Выявлена неспособность моделей точно оценивать индивидуальные различия в откликах на специфические воздействия (imprecise treatment-response estimates).
- Работа ставит под сомнение надежность текущих методов валидации ИИ-агентов как полноценных заменителей человеческих респондентов в научных и рыночных исследованиях.