Исследователи проанализировали эффективность двух подходов к переранжированию (reranking) медицинских процедур при обработке запросов пациентов: использование специализированных кросс-энкодеров и агентное дообучение LLM. Работа направлена на преодоление лексического разрыва между бытовым языком пользователей и профессиональной клинической терминологией, что критически важно для точности информационного поиска в системах медицинского страхования.

В рамках исследования сравнивались компактные модели, такие как MedCPT и MiniLM-L12, обученные с использованием listwise-подхода (обучение ранжированию списков), и агентные методы настройки инструкций. Авторы оценивали способность моделей сопоставлять неструктурированные запросы пациентов с формализованными медицинскими процедурами, где точность поиска напрямую влияет на корректность обработки страховых случаев.

Результаты показывают, что выбор архитектуры переранжировщика существенно зависит от специфики данных и требований к вычислительной эффективности. Кросс-энкодеры демонстрируют высокую точность при работе с узкоспециализированными медицинскими корпусами, тогда как агентные подходы предлагают гибкость в интерпретации сложных, многоступенчатых запросов, требующих глубокого контекстуального понимания медицинской документации.

Ключевые факты

  • Исследование сфокусировано на решении проблемы лексического разрыва между запросами пациентов и клинической номенклатурой.
  • Сравнивались два метода: listwise-обучение компактных кросс-энкодеров (MedCPT, MiniLM-L12) и агентная настройка инструкций (instruction tuning).
  • Работа проводилась в контексте автоматизации поиска в системах медицинского страхования.
  • Анализ подтвердил, что выбор между специализированными моделями и агентными методами зависит от баланса между точностью и вычислительными затратами.