Исследователи представили концептуальную базу для оценки медицинских ИИ-систем, претендующих на уровень суперинтеллекта. Авторы предлагают перейти от стандартных тестов на знание фактов к комплексной оценке способности моделей к автономному принятию клинических решений, диагностике редких патологий и долгосрочному планированию лечения, что критически важно для безопасного внедрения автономных агентов в здравоохранение.

Текущие бенчмарки для медицинских LLM часто ограничиваются проверкой ответов на вопросы с множественным выбором, что не отражает реальную клиническую практику. Предложенная методология фокусируется на «динамическом тестировании», где модель должна демонстрировать способность к рассуждению в условиях неопределенности, учитывать мультимодальные данные (результаты анализов, визуализацию) и следовать этическим протоколам при постановке диагноза.

Авторы подчеркивают, что по мере приближения моделей к уровню экспертов-люди, риск «галлюцинаций» и ошибок в логических цепочках становится критическим. Новая система оценки предполагает использование симулированных сред, где ИИ взаимодействует с виртуальными пациентами, а его действия оцениваются консилиумом врачей по критериям точности, безопасности и обоснованности назначений.

Ключевые факты

  • Методология направлена на переход от статических тестов (типа USMLE) к оценке автономного клинического мышления.
  • Основной упор сделан на проверку способности ИИ к интеграции мультимодальных данных и долгосрочному ведению пациентов.
  • Предложены критерии оценки «безопасности принятия решений», исключающие риск необоснованных медицинских вмешательств.
  • Исследование опубликовано в журнале Nature Medicine, что задает новый стандарт для валидации медицинских ИИ-систем будущего.