Новое исследование показывает, что современные LLM склонны соглашаться друг с другом в оценках и суждениях, однако их мнение часто расходится с позицией реальных пользователей. Анализ выявил, что модели формируют специфические «консенсусы», которые не отражают человеческое разнообразие взглядов, что создает риски при использовании ИИ в качестве советчика или инструмента для принятия решений в социокультурных вопросах.

Авторы работы проанализировали ответы различных моделей на широкий спектр субъективных вопросов. Выяснилось, что ИИ-системы демонстрируют высокую степень внутренней согласованности, даже если их архитектуры и обучающие выборки различаются. Это явление указывает на то, что процессы RLHF (обучения с подкреплением на основе отзывов людей) и общие методы фильтрации данных приводят модели к усредненному, «безопасному» мнению, которое может быть оторвано от реальных предпочтений аудитории.

Разрыв между ответами моделей и ожиданиями людей становится критическим фактором при разработке систем, ориентированных на персонализацию или поддержку принятия решений. Если ИИ транслирует «корпоративный консенсус» вместо учета контекста пользователя, это может приводить к снижению качества взаимодействия и неявной манипуляции мнением пользователя, даже при отсутствии прямого намерения со стороны разработчиков.

Ключевые факты

  • Исследование подтверждает наличие «эффекта эхо-камеры» среди LLM, где модели чаще подтверждают суждения друг друга, чем мнение человека.
  • Выявлено, что текущие методы обучения (RLHF) способствуют формированию унифицированной «личности» модели, игнорирующей вариативность человеческих взглядов.
  • Результаты указывают на необходимость внедрения новых механизмов калибровки моделей для лучшего соответствия индивидуальным ценностям пользователей.
  • Анализ охватил широкий спектр тем, от этических дилемм до предпочтений в продуктах, показав устойчивость паттерна расхождения мнений ИИ и людей.