Попытки получить от больших языковых моделей оценку уверенности в ответе часто приводят к неверным результатам. Исследования показывают, что LLM склонны к чрезмерной самоуверенности даже при генерации фактических ошибок. Вместо прямой оценки вероятности эксперты рекомендуют использовать альтернативные методы верификации, такие как самопроверка, анализ логитов или сопоставление ответов нескольких моделей для повышения надежности систем.

Основная проблема заключается в том, что архитектура трансформеров оптимизирована для предсказания следующего токена, а не для калибровки вероятностей в человеческом понимании. Когда модель просят оценить, насколько она уверена в своем ответе, она фактически выполняет еще одну задачу генерации текста, которая подвержена тем же галлюцинациям, что и основной запрос. Это создает иллюзию точности, которая может быть опасна в критически важных бизнес-приложениях.

Для повышения надежности агентных систем разработчикам предлагается переходить от оценки «уверенности» к методам верификации через RAG-источники или многошаговую проверку фактов. Использование логитов (raw logits) для оценки уверенности также имеет ограничения, так как они отражают лишь статистическую вероятность выбора токена из словаря, а не истинность утверждения в контексте реального мира.

Ключевые факты

  • LLM демонстрируют слабую корреляцию между самооценкой уверенности и фактической точностью ответов.
  • Прямой запрос к модели «насколько ты уверен» является генеративной задачей, а не статистическим расчетом.
  • Анализ логитов ограничен рамками обучающей выборки и не учитывает внешние факты, отсутствующие в весах модели.
  • Рекомендуемые альтернативы включают использование внешних баз знаний, проверку через цепочки рассуждений (Chain-of-Thought) и кросс-валидацию ответов несколькими независимыми агентами.