Новое исследование выявило критическую уязвимость больших языковых моделей в задачах на здравый смысл. Модели склонны отдавать предпочтение статистически вероятным, но логически неверным ассоциациям, игнорируя контекстуальные детали. Этот феномен, названный «предвзятостью значимости» (salience bias), приводит к ошибкам в рассуждениях, когда модель выбирает наиболее часто встречающийся в обучающей выборке сценарий вместо анализа конкретной ситуации.

Авторы работы проанализировали, как LLM справляются с задачами, где привычные шаблоны поведения противоречат логике конкретного запроса. Например, в сценариях, требующих оценки последовательности действий, модели часто «галлюцинируют» стандартные шаги, даже если они невозможны в заданных условиях. Это демонстрирует, что текущие архитектуры опираются скорее на вероятностное предсказание токенов, чем на глубокое понимание причинно-следственных связей.

Результаты исследования подчеркивают ограничения современных методов обучения с подкреплением на основе отзывов людей (RLHF). Хотя RLHF помогает моделям звучать более убедительно, он может усиливать предвзятость значимости, поощряя ответы, которые кажутся «правильными» с точки зрения человеческих стереотипов, но не выдерживают проверки строгой логикой. Это создает риски при использовании ИИ в критических областях, где требуется точное следование инструкциям в нестандартных условиях.

Ключевые факты

  • Исследование сфокусировано на «предвзятости значимости» (salience bias), при которой модели игнорируют контекст в пользу статистически частых ассоциаций.
  • Выявлено, что модели систематически ошибаются в задачах на здравый смысл, если стандартный сценарий противоречит условиям задачи.
  • Авторы указывают на то, что текущие методы RLHF могут непреднамеренно усиливать склонность моделей к стереотипным ответам.
  • Работа ставит под сомнение способность современных LLM к истинному логическому выводу, подчеркивая доминирование вероятностного сопоставления паттернов.