Исследователи выявили критическую уязвимость современных больших языковых моделей, названную «предвзятостью значимости» (Salience Bias). В задачах на здравый смысл модели склонны чрезмерно полагаться на явные, но бесполезные детали во входных данных, такие как случайные числа или второстепенные условия. Это приводит к игнорированию контекста и логическим ошибкам, даже если модель способна решать сложные задачи.

Проблема заключается в механизме внимания моделей, который приоритизирует любые явно выраженные признаки, даже если они не несут смысловой нагрузки для конкретной задачи. В тестах на повседневную логику LLM часто выбирают неверные ответы, если в условии задачи присутствуют «отвлекающие» числовые параметры. Модель фокусируется на цифрах, игнорируя базовые физические или социальные закономерности, которые человек учитывает автоматически.

Авторы работы подчеркивают, что этот эффект подрывает надежность моделей в реальных сценариях, где входные данные часто содержат много «шума». В отличие от человека, который умеет фильтровать контекст, нейросети воспринимают все элементы ввода как равнозначные сигналы для принятия решения. Это открытие ставит под сомнение эффективность текущих методов обучения при работе с неструктурированной информацией из реального мира.

Ключевые факты

  • Salience Bias проявляется в том, что модели «захватываются» бесполезными явными дистракторами, игнорируя фундаментальные правила здравого смысла.
  • В экспериментах наличие числовых значений во входных данных приводило к резкому снижению точности ответов на логические вопросы.
  • Модели демонстрируют неспособность отличать релевантные факты от информационного шума, что критично для систем, работающих с пользовательскими запросами.
  • Исследование указывает на необходимость изменения подходов к обучению моделей для улучшения их способности к фильтрации контекста.