Исследователи представили PathAgentBench — специализированный бенчмарк для оценки мультимодальных моделей в задачах цифровой патологии. В отличие от существующих решений, работающих с заранее подготовленными фрагментами изображений, этот инструмент проверяет способность ИИ самостоятельно анализировать полноразмерные гигапиксельные слайды (WSI), последовательно собирая доказательства на разных уровнях масштабирования для постановки диагноза.

Диагностика по цельным слайдам требует от модели не только распознавания паттернов, но и сложной навигации по изображению, аналогичной работе врача-патологоанатома. Текущие методы часто ограничиваются анализом уже вырезанных областей, что не позволяет оценить реальную эффективность ИИ в клинических условиях, где модель должна сама определять значимые зоны интереса на огромном полотне данных.

PathAgentBench имитирует агентный подход к анализу медицинских изображений. Модель должна продемонстрировать навыки поиска диагностически важных участков, переключения между уровнями детализации и интеграции полученных данных в единое заключение. Такой подход позволяет выявить пробелы в способности моделей к долгосрочному планированию и контекстуальному анализу в узкоспециализированных медицинских задачах.

Ключевые факты

  • Бенчмарк сфокусирован на анализе полноразмерных гигапиксельных изображений (WSI), а не на отдельных патчах.
  • Основная задача модели — имитация процесса поиска доказательств, включая навигацию по разным уровням масштабирования.
  • Методология направлена на оценку способности ИИ к самостоятельному принятию решений в условиях ограниченного времени и огромного объема визуальных данных.
  • Исследование подчеркивает разрыв между текущими возможностями моделей и требованиями реальной клинической практики в патологии.