Исследователи проанализировали, насколько эффективно малые языковые модели (от 0,5B до 14B параметров) могут оценивать собственную уверенность в ответах для принятия решения о передаче задачи человеку. Работа показывает, что вербальная уверенность моделей часто не соответствует реальной точности, что ограничивает их применение в критически важных сценариях, требующих контролируемого риска и надежной автоматизации.
В ходе эксперимента протестировано одиннадцать моделей из трех различных семейств. Авторы сфокусировались на сценариях, где использование ИИ ограничено локальной инфраструктурой или жесткими требованиями к стоимости вычислений. Основная проблема заключается в том, что модели склонны к излишней самоуверенности, из-за чего механизмы «отложенного ответа» (deferral) работают недостаточно эффективно без дополнительных методов калибровки.
Результаты исследования подчеркивают необходимость внедрения сертифицированных методов оценки неопределенности для малых моделей. Вместо того чтобы полагаться на внутреннюю оценку уверенности самой модели, разработчикам рекомендуется использовать внешние алгоритмы контроля риска. Это позволяет минимизировать ошибки в задачах, где точность ответа критически важна, а вычислительные ресурсы ограничены.
Ключевые факты
- Исследованы 11 моделей с количеством параметров от 0,5B до 14B.
- Тестирование проводилось на бенчмарке ARC-Challenge для оценки способности моделей к логическому выводу.
- Установлено, что вербальная уверенность моделей не является надежным индикатором для автоматического делегирования задач человеку.
- Предложены методы сертифицированного отложенного ответа (certified deferral) для повышения безопасности использования малых моделей в продакшене.