Исследователи представили метод управления инференсом для устранения кросс-языковых фактических противоречий в больших языковых моделях. Проблема заключается в смещении ответов модели в зависимости от языка запроса из-за доминирования высокоресурсных языков в обучающих данных. Новый подход позволяет корректировать распределение вероятностей ответов непосредственно в процессе генерации, обеспечивая согласованность фактов независимо от выбранного пользователем языка.

Традиционные модели часто демонстрируют разное качество знаний при переключении между языками, что критично для международных систем и мультиязычных баз знаний. Авторы работы предлагают механизм «направления» (steering), который воздействует на внутренние представления модели во время инференса. Это позволяет минимизировать галлюцинации и фактические искажения, возникающие при переводе или интерпретации запросов на менее распространенных языках.

Данное решение не требует дообучения (fine-tuning) модели, что делает его эффективным инструментом для повышения надежности существующих LLM. Метод фокусируется на выравнивании скрытых состояний модели, чтобы ответы на фактологические вопросы оставались идентичными по смыслу и точности, даже если запрос сформулирован на языке с меньшим объемом обучающих данных.

Ключевые факты

  • Исследование направлено на решение проблемы кросс-языковой фактической несогласованности в LLM.
  • Метод работает на этапе инференса, не требуя изменения весов модели или дополнительного обучения.
  • Техника использует управление внутренними представлениями для компенсации языковых смещений.
  • Подход позволяет сохранять точность ответов при переходе от высокоресурсных языков к низкоресурсным.