Исследователи представили MedUPS — фреймворк для оценки способности LLM помогать врачам в диагностике редких и нестандартных медицинских случаев. В отличие от существующих бенчмарков, фокусирующихся только на итоговом диагнозе, MedUPS оценивает последовательность клинических решений, включая выбор необходимых анализов и методов визуализации, что критически важно при работе в условиях неопределенности и неполных данных.
Традиционные медицинские тесты для ИИ часто опираются на статические вопросы с выбором ответа, которые не отражают реальный процесс оказания помощи. В клинической практике врач сталкивается с динамическим потоком информации, где каждое последующее действие зависит от результатов предыдущего шага. MedUPS моделирует этот процесс, заставляя модель планировать диагностический путь, что делает систему более применимой для поддержки врачей в сложных ситуациях, выходящих за рамки стандартных протоколов.
Методология MedUPS позволяет оценивать не только точность постановки диагноза, но и обоснованность выбора диагностических процедур на каждом этапе. Это приближает возможности больших языковых моделей к реальным потребностям клинической медицины, где цена ошибки при выборе следующего шага крайне высока. Исследование подчеркивает необходимость перехода от оценки «статических знаний» моделей к оценке их способности к «клиническому рассуждению» в условиях ограниченного времени и нехватки информации.
Ключевые факты
- MedUPS фокусируется на редких и нестандартных медицинских случаях, которые часто игнорируются в стандартных наборах данных.
- Система оценивает не только финальный диагноз, но и последовательность принятия решений: назначение тестов и визуализаций.
- Фреймворк учитывает фактор диагностической неопределенности, с которой врачи сталкиваются при неполном объеме данных.
- Разработка направлена на преодоление ограничений существующих бенчмарков, которые не учитывают динамический характер клинической практики.