Исследователи проанализировали, как современные большие языковые модели закрепляют доминирование определенных диалектов английского языка. Работа показывает, что алгоритмы отдают предпочтение нормам «внутреннего круга» (США, Великобритания), маргинализируя региональные варианты. Это создает риск унификации языка и подавления лингвистического разнообразия, что напрямую влияет на то, какие формы речи воспринимаются как «правильные» в глобальных цифровых коммуникациях.

Авторы статьи исследуют социолингвистический аспект разработки ИИ, подчеркивая, что выбор данных для обучения моделей не является нейтральным процессом. Использование преимущественно стандартных корпусов текстов приводит к тому, что модели транслируют предвзятые представления о «легитимности» языка. Это закрепляет иерархию, в которой носители стандартных диалектов получают преимущество, а пользователи других вариантов английского сталкиваются с искажениями или непониманием со стороны систем.

Проблема выходит за рамки лингвистики, затрагивая вопросы инклюзивности и доступности технологий. Если ИИ-системы продолжат игнорировать вариативность языка, это может привести к усилению цифрового неравенства. Исследование призывает разработчиков учитывать социолингвистические факторы при формировании обучающих выборок, чтобы избежать закрепления устаревших идеологических установок в глобальных технологических продуктах.

Ключевые факты

  • Исследование сфокусировано на анализе того, как LLM воспроизводят и усиливают идеологии «стандартного» английского языка.
  • Модели демонстрируют систематическое предпочтение нормам Inner Circle, игнорируя вариативность World Englishes.
  • Авторы указывают на риск лингвистической гомогенизации, вызванной доминированием ограниченных наборов данных при обучении.
  • Работа подчеркивает необходимость пересмотра подходов к сбору данных для обеспечения инклюзивности ИИ-систем.