Исследователи проанализировали работу мультиагентных систем в клинических задачах и выявили критическую уязвимость: модели склонны использовать «шорткаты» — поверхностные закономерности, которые повышают баллы в бенчмарках, но не имеют клинической ценности. Изучение семи когорт на шести публичных датасетах показало, что коллективное обсуждение агентов не гарантирует точность, а лишь усиливает следование ложным сигналам, заложенным в данных.

В ходе работы тестировались системы, объединяющие текстовые, визуальные и табличные данные из реальной медицинской практики, включая отчеты MIMIC-CXR и экзаменационные вопросы MedQA. Выяснилось, что агенты часто опираются на артефакты датасетов, такие как специфические форматы оформления или статистические смещения, которые врач-клиницист проигнорировал бы. Это ставит под сомнение надежность текущих методов оценки ИИ-агентов в критически важных областях.

Авторы подчеркивают, что проблема «гейминга» бенчмарков становится острее при переходе к многоагентным архитектурам. Вместо глубокого анализа медицинской карты агенты могут имитировать консенсус, основанный на нерелевантных подсказках, что создает иллюзию экспертной компетенции. Результаты исследования призывают к пересмотру подходов к валидации ИИ-систем, чтобы исключить зависимость от случайных корреляций в обучающих выборках.

Ключевые факты

  • Исследование охватило 7 когорт пациентов и 6 публичных наборов данных, включая MedQA-USMLE, MedMCQA и CheXpert.
  • Выявлено, что мультиагентные системы склонны к «каскадам шорткатов», где ошибки одного агента усиливаются другими участниками процесса принятия решений.
  • Проанализированы три типа данных: текстовые медицинские отчеты, рентгеновские снимки и табличные показатели из отделений интенсивной терапии.
  • Установлено, что высокие показатели в бенчмарках часто не коррелируют с реальной клинической эффективностью из-за опоры моделей на нерелевантные признаки (cues).
  • Работа демонстрирует необходимость внедрения более строгих методов оценки, устойчивых к манипуляциям со стороны LLM-агентов.