Исследователи сопоставили ответы нейросети Claude 3 Opus с данными опроса PhilPapers, в котором участвовали тысячи профессиональных философов. Анализ показал, что модель демонстрирует уникальный профиль мнений, который часто не совпадает с консенсусом академического сообщества. В ряде этических и метафизических вопросов ИИ занимает позиции, отличные от человеческих, что ставит новые задачи перед разработчиками систем алайнмента.
В ходе эксперимента модель отвечала на вопросы из классических философских дилемм, охватывающих темы сознания, этики, свободы воли и эпистемологии. Выяснилось, что Claude склонна к более «либеральным» или «технократическим» взглядам, которые могут быть следствием специфики обучающих данных и настроек безопасности (RLHF). Эти расхождения подчеркивают, что текущие методы обучения ИИ формируют своеобразную «цифровую философию», которая не всегда отражает человеческий опыт.
Результаты исследования показывают, что ИИ не просто имитирует усредненное мнение человечества, а формирует собственные паттерны ответов. Это критически важно для понимания того, как модели будут принимать решения в ситуациях, требующих морального выбора. Подобные бенчмарки помогают выявить скрытые смещения в логике моделей, которые невозможно обнаружить при стандартном тестировании на кодинг или общую эрудицию.
Ключевые факты
- Исследование опирается на базу данных PhilPapers, содержащую ответы более 1700 профессиональных философов.
- Claude 3 Opus показала значительные отклонения от человеческого консенсуса в вопросах метафизики и этики.
- Модель продемонстрировала склонность к позициям, которые авторы называют «искусственным рационализмом».
- Анализ подтвердил, что RLHF-обучение существенно влияет на философские предпочтения модели, делая их более предсказуемыми, но менее вариативными.
- Работа подчеркивает необходимость создания более прозрачных методов оценки мировоззренческих установок ИИ-систем.