Исследователи представили CARE-Bench — специализированный бенчмарк для оценки LLM и ИИ-агентов, взаимодействующих с пациентами. Инструмент фокусируется на безопасности первичного медицинского триажа, проверяя способность моделей корректно определять дальнейшие действия пользователя на основе симптомов. Набор данных включает 500 клинических случаев и более тысячи сценариев, что позволяет стандартизировать проверку точности рекомендаций до обращения к врачу.

В современных медицинских системах ИИ всё чаще выступает первым звеном коммуникации, собирая анамнез и оценивая срочность состояния. Основная сложность заключается в последовательном характере диалога, где модель должна учитывать контекст предыдущих ответов пациента. CARE-Bench решает эту проблему, предлагая классификацию действий на каждом шаге взаимодействия, что критически важно для предотвращения ошибок в постановке приоритетов оказания помощи.

Бенчмарк опирается на методологию, основанную на реальных источниках, что минимизирует галлюцинации и повышает достоверность оценки. Разработчики медицинских решений могут использовать этот инструмент для тестирования агентных систем на предмет соблюдения протоколов безопасности и точности маршрутизации пациентов в зависимости от тяжести симптоматики.

Ключевые факты

  • CARE-Bench содержит 500 детализированных клинических случаев для тестирования моделей.
  • В состав бенчмарка включено 1 059 оценочных префиксов раскрытия информации пациентом.
  • Методология оценивает действия ИИ как задачу классификации по четырем меткам на каждом этапе диалога.
  • Основная цель инструмента — обеспечение безопасности при автоматизированном триаже до контакта с медицинским специалистом.