Исследователи представили бенчмарк OptimismBench, выявляющий склонность языковых моделей к систематическому оптимизму при оценке вероятностей. Анализ показал, что модели часто завышают шансы на успех в сценариях, где отсутствует объективная истина, что создает риски при использовании ИИ в качестве инструмента поддержки принятия решений. Исследование подчеркивает необходимость разработки новых методов калибровки вероятностных суждений в LLM.
Проблема заключается в том, что стандартные метрики калибровки часто не учитывают направленность ошибок, фокусируясь лишь на их величине. Когда модель оценивает вероятность успеха стартапа в 70%, а вероятность его провала в 15%, сумма вероятностей не достигает 100%, что указывает на внутренний «оптимистический сдвиг». Этот эффект становится особенно заметным в задачах, где ИИ выступает в роли аналитика или советника, влияя на бизнес-стратегии и инвестиционные решения.
Авторы работы также исследовали влияние процесса алайнмента на эту предвзятость. Оказалось, что методы настройки моделей, направленные на повышение полезности и вежливости, могут непреднамеренно усиливать склонность к позитивным прогнозам. Это создает «эффект алайнмента», при котором модель стремится давать ответы, соответствующие ожиданиям пользователя, жертвуя при этом статистической точностью и нейтральностью оценок.
Ключевые факты
- OptimismBench разработан для измерения направленного смещения вероятностных суждений в LLM.
- Выявлено, что модели склонны завышать вероятность благоприятных исходов в ситуациях с неопределенностью.
- Процессы алайнмента (RLHF и аналоги) статистически коррелируют с усилением оптимистического сдвига.
- Несоответствие суммы вероятностей противоположных событий (успех/провал) является ключевым индикатором предвзятости модели.
- Исследование подчеркивает критическую важность аудита моделей перед их интеграцией в системы поддержки принятия решений.