Исследователи изучили, как использование промптов на достаточность доказательств (evidence-sufficiency) влияет на поведение клинических языковых моделей. Выяснилось, что такие инструкции действительно снижают количество самоуверенных, но потенциально опасных ответов. Однако эффективность метода сильно зависит от того, какая именно модель выступает в роли «судьи» при оценке безопасности, что ставит под вопрос объективность текущих метрик оценки ИИ в медицине.

В работе анализируется конфликт между безопасностью и полезностью модели. Принуждение системы к строгому соблюдению принципа достаточности доказательств часто приводит к снижению общей информативности ответов. Это создает проблему выбора: либо модель становится более осторожной, но менее полезной для врача, либо сохраняет высокую точность, рискуя выдать необоснованное утверждение за истину.

Авторы подчеркивают, что «безопасность», зафиксированная автоматизированными системами оценки, не всегда отражает реальные изменения в логике модели. Часто наблюдаемый прогресс — это лишь следствие того, как конкретный «судья» интерпретирует соответствие ответа заданному шаблону. Это указывает на необходимость разработки более устойчивых и независимых от конкретных моделей инструментов для валидации ИИ в критически важных отраслях.

Ключевые факты

  • Исследование сфокусировано на использовании промптов для проверки достаточности доказательств в клинических LLM.
  • Установлено, что «безопасность» модели напрямую коррелирует с настройками и типом модели-судьи, используемой для оценки.
  • Внедрение строгих ограничений на достаточность доказательств приводит к измеримому снижению полезности ответов для конечного пользователя.
  • Результаты ставят под сомнение надежность текущих бенчмарков безопасности, которые опираются на автоматизированную оценку ответов другими LLM.