Исследователи представили метод управления инференсом для устранения кросс-языковых фактических противоречий в больших языковых моделях. Проблема заключается в смещении ответов модели в зависимости от языка запроса из-за доминирования высокоресурсных языков в обучающих данных. Новый подход позволяет корректировать распределение вероятностей ответов непосредственно в процессе генерации, обеспечивая согласованность фактов независимо от выбранного пользователем языка.
Традиционные модели часто демонстрируют разное качество знаний при переключении между языками, что критично для международных систем и мультиязычных баз знаний. Авторы работы предлагают механизм «направления» (steering), который воздействует на внутренние представления модели во время инференса. Это позволяет минимизировать галлюцинации и фактические искажения, возникающие при переводе или интерпретации запросов на менее распространенных языках.
Данное решение не требует дообучения (fine-tuning) модели, что делает его эффективным инструментом для повышения надежности существующих LLM. Метод фокусируется на выравнивании скрытых состояний модели, чтобы ответы на фактологические вопросы оставались идентичными по смыслу и точности, даже если запрос сформулирован на языке с меньшим объемом обучающих данных.
Ключевые факты
- Исследование направлено на решение проблемы кросс-языковой фактической несогласованности в LLM.
- Метод работает на этапе инференса, не требуя изменения весов модели или дополнительного обучения.
- Техника использует управление внутренними представлениями для компенсации языковых смещений.
- Подход позволяет сохранять точность ответов при переходе от высокоресурсных языков к низкоресурсным.