Исследователи проанализировали, как методы отбора данных влияют на согласованность человеческих оценок в задачах логического вывода на естественном языке (NLI). Работа ставит под сомнение выводы предыдущих исследований, основанных на выборках с высоким уровнем разногласий, показывая, что использование «неотфильтрованных» наборов данных меняет понимание того, как люди интерпретируют монотонные операторы и логические конструкции.
Предыдущие работы часто опирались на ресурсы вроде ChaosNLI, где данные намеренно отбирались по критерию высокого уровня разногласий между аннотаторами. Это создавало искаженное представление о том, насколько стабильно люди воспринимают логические операторы, такие как отрицание или кванторы. Новое исследование демонстрирует, что при работе с более репрезентативными, не отобранными по уровню споров выборками, показатели согласия (label agreement) существенно меняются.
Авторы подчеркивают важность методологии формирования датасетов для обучения и оценки языковых моделей. Если бенчмарки строятся на данных, где искусственно максимизирована неопределенность, модели могут перенимать эти искажения, что негативно сказывается на их способности к логическому рассуждению. Работа подтверждает необходимость пересмотра подходов к созданию обучающих выборок, чтобы они отражали естественное распределение мнений, а не только спорные кейсы.
Ключевые факты
- Исследование является пререгистрированной репликацией, направленной на проверку устойчивости выводов о связи монотонности и согласия аннотаторов.
- Предыдущие данные (ChaosNLI) фокусировались исключительно на элементах с высоким уровнем разногласий, что приводило к заниженным показателям согласованности (Cliff's delta = -0.284 для невосходящих операторов).
- Работа доказывает, что выборка данных (selection bias) является критическим фактором, определяющим наблюдаемые закономерности в поведении аннотаторов.
- Результаты указывают на необходимость использования более широких, неселективных наборов данных для оценки способности моделей к логическому выводу.