Исследователи представили бенчмарк OptimismBench, выявляющий склонность языковых моделей к систематическому оптимизму при оценке вероятностей. Анализ показал, что модели часто завышают шансы на успех в сценариях, где отсутствует объективная истина, что создает риски при использовании ИИ в качестве инструмента поддержки принятия решений. Исследование подчеркивает необходимость разработки новых методов калибровки вероятностных суждений в LLM.

Проблема заключается в том, что стандартные метрики калибровки часто не учитывают направленность ошибок, фокусируясь лишь на их величине. Когда модель оценивает вероятность успеха стартапа в 70%, а вероятность его провала в 15%, сумма вероятностей не достигает 100%, что указывает на внутренний «оптимистический сдвиг». Этот эффект становится особенно заметным в задачах, где ИИ выступает в роли аналитика или советника, влияя на бизнес-стратегии и инвестиционные решения.

Авторы работы также исследовали влияние процесса алайнмента на эту предвзятость. Оказалось, что методы настройки моделей, направленные на повышение полезности и вежливости, могут непреднамеренно усиливать склонность к позитивным прогнозам. Это создает «эффект алайнмента», при котором модель стремится давать ответы, соответствующие ожиданиям пользователя, жертвуя при этом статистической точностью и нейтральностью оценок.

Ключевые факты

  • OptimismBench разработан для измерения направленного смещения вероятностных суждений в LLM.
  • Выявлено, что модели склонны завышать вероятность благоприятных исходов в ситуациях с неопределенностью.
  • Процессы алайнмента (RLHF и аналоги) статистически коррелируют с усилением оптимистического сдвига.
  • Несоответствие суммы вероятностей противоположных событий (успех/провал) является ключевым индикатором предвзятости модели.
  • Исследование подчеркивает критическую важность аудита моделей перед их интеграцией в системы поддержки принятия решений.