Исследователи представили метод улучшения калибровки больших языковых моделей, решающий проблему избыточной самоуверенности после этапа выравнивания предпочтений (alignment). Вместо классического пост-хок масштабирования температуры, которое плохо обобщается на разные домены, авторы предлагают модифицировать параметры модели в процессе обучения, максимизируя энтропию предсказательных распределений через двухуровневую оптимизацию.
Традиционные методы калибровки, такие как масштабирование температуры, часто оказываются неэффективными, так как параметры, подобранные для одного типа задач, не работают при смене контекста. Новый подход интегрирует калибровку непосредственно в процесс обучения, что позволяет модели лучше оценивать вероятность своих ответов и снижать риск галлюцинаций, вызванных необоснованной уверенностью нейросети в неверных данных.
Предложенный алгоритм позволяет достичь более точной калибровки без потери производительности модели на основных задачах. Это критически важно для систем, где требуется высокая степень доверия к ответам ИИ, например, в медицине, юриспруденции или аналитике, где модель должна корректно выражать степень своей неуверенности в случае отсутствия точных данных.
Ключевые факты
- Метод заменяет пост-хок масштабирование температуры на двухуровневую оптимизацию параметров модели.
- Основная цель — устранение избыточной самоуверенности, возникающей после этапа обучения с подкреплением на основе отзывов людей (RLHF).
- Подход максимизирует энтропию предсказательных распределений для достижения лучшей калибровки в различных доменах.
- Решение обеспечивает стабильную работу модели при смене домена, в отличие от классических методов, привязанных к конкретным данным.