Исследователи представили модель, способную анализировать аудиовизуальные данные в реальном времени для поддержки врачебных консультаций. Система учитывает невербальные сигналы и естественную речь, преодолевая ограничения текстовых ИИ-инструментов. Разработка направлена на повышение точности диагностики и доступности медицинской помощи для пациентов, которым сложно письменно описать свои симптомы, обеспечивая экспертный уровень взаимодействия в ходе видеосвязи.

Традиционные медицинские системы на базе LLM часто игнорируют важные визуальные и аудиальные аспекты, такие как мимика, жесты или интонация, которые критически важны для оценки состояния пациента. Новая архитектура интегрирует обработку видеопотока и звука, позволяя ИИ «видеть» и «слышать» пациента в контексте живого диалога. Это приближает возможности автоматизированных систем к уровню квалифицированного специалиста, способного считывать клинически значимые невербальные маркеры.

Технология ориентирована на интеграцию в платформы телемедицины, где качество сбора анамнеза напрямую влияет на постановку диагноза. В отличие от чат-ботов, требующих от пользователя структурированного ввода данных, данный подход минимизирует когнитивную нагрузку на пациента, позволяя ему общаться в привычном формате видеозвонка. Это открывает возможности для автоматизации первичного скрининга и поддержки принятия врачебных решений в режиме реального времени.

Ключевые факты

  • Модель переходит от текстового анализа к обработке аудиовизуальных данных, имитируя естественное общение врача и пациента.
  • Система учитывает невербальные сигналы, которые критически важны для постановки диагноза и оценки тяжести состояния.
  • Разработка направлена на устранение барьеров для пациентов, испытывающих трудности с письменным изложением симптомов.
  • Технология предназначена для работы в режиме реального времени в рамках видеоконсультаций, повышая эффективность телемедицинских сервисов.