Исследование Artifipedia объясняет, почему качество работы LLM сильно варьируется в зависимости от языка. Основная причина кроется в диспропорции данных при обучении: подавляющий объем обучающих корпусов приходится на английский, что создает «языковой разрыв». В результате модели хуже справляются с логикой, нюансами и культурным контекстом в менее представленных языках, даже если они формально поддерживаются.
Проблема усугубляется токенизацией: большинство моделей используют словари, оптимизированные под английский язык. Для других языков это приводит к неэффективному разбиению текста на токены, что увеличивает расход контекстного окна и снижает точность рассуждений. В итоге модель тратит больше вычислительных ресурсов на обработку простых предложений, при этом чаще допуская фактические ошибки.
Авторы подчеркивают, что даже при наличии качественных переводов, модели часто наследуют англоцентричную картину мира. Это ограничивает их применимость в задачах, требующих глубокого понимания локальных реалий, юридической специфики или неформальных диалектов. Разработчикам рекомендуется учитывать эти ограничения при выборе моделей для мультиязычных продуктов и внедрять дополнительные этапы проверки качества.
Ключевые факты
- Основной объем данных для обучения современных LLM (более 90%) составляют англоязычные тексты.
- Неэффективная токенизация для неанглийских языков увеличивает количество токенов на одно и то же сообщение в 3–5 раз.
- Ошибки в логических задачах при переходе с английского на другие языки возрастают пропорционально снижению доли языка в обучающей выборке.
- Использование специализированных токенизаторов и дообучение на качественных локальных корпусах данных частично нивелирует разрыв в производительности.