Исследователи проанализировали, как методы отбора данных влияют на согласованность человеческих оценок в задачах логического вывода на естественном языке (NLI). Работа ставит под сомнение выводы предыдущих исследований, основанных на выборках с высоким уровнем разногласий, показывая, что использование «неотфильтрованных» наборов данных меняет понимание того, как люди интерпретируют монотонные операторы и логические конструкции.

Предыдущие работы часто опирались на ресурсы вроде ChaosNLI, где данные намеренно отбирались по критерию высокого уровня разногласий между аннотаторами. Это создавало искаженное представление о том, насколько стабильно люди воспринимают логические операторы, такие как отрицание или кванторы. Новое исследование демонстрирует, что при работе с более репрезентативными, не отобранными по уровню споров выборками, показатели согласия (label agreement) существенно меняются.

Авторы подчеркивают важность методологии формирования датасетов для обучения и оценки языковых моделей. Если бенчмарки строятся на данных, где искусственно максимизирована неопределенность, модели могут перенимать эти искажения, что негативно сказывается на их способности к логическому рассуждению. Работа подтверждает необходимость пересмотра подходов к созданию обучающих выборок, чтобы они отражали естественное распределение мнений, а не только спорные кейсы.

Ключевые факты

  • Исследование является пререгистрированной репликацией, направленной на проверку устойчивости выводов о связи монотонности и согласия аннотаторов.
  • Предыдущие данные (ChaosNLI) фокусировались исключительно на элементах с высоким уровнем разногласий, что приводило к заниженным показателям согласованности (Cliff's delta = -0.284 для невосходящих операторов).
  • Работа доказывает, что выборка данных (selection bias) является критическим фактором, определяющим наблюдаемые закономерности в поведении аннотаторов.
  • Результаты указывают на необходимость использования более широких, неселективных наборов данных для оценки способности моделей к логическому выводу.