Исследователи из Университета Южной Калифорнии (USC) выяснили, что современные языковые модели демонстрируют значительно более высокую точность при обработке текстовой информации по сравнению с аудиоданными. В ходе экспериментов ИИ показал лучшие результаты в понимании контекста, логических связей и эмоциональной окраски, когда данные были представлены в письменном виде, что указывает на ограничения текущих мультимодальных систем при работе с речью.

Авторы работы проанализировали способность моделей интерпретировать социальные сигналы, такие как сарказм, неуверенность или скрытый подтекст. Выяснилось, что при анализе аудиозаписей модели чаще допускают ошибки, связанные с фоновым шумом, особенностями интонации и темпом речи. В то же время текстовые транскрипции позволяют алгоритмам эффективнее извлекать семантические значения, что делает их более надежными инструментами для анализа документов, чем для обработки живого общения.

Результаты исследования подчеркивают разрыв в производительности между текстовыми и аудио-модальностями. Это создает барьеры для внедрения ИИ в сферы, требующие глубокого анализа устной коммуникации, такие как психологическое консультирование, клиентская поддержка или проведение интервью. Разработчикам предстоит решить проблему «потери данных» при конвертации аудио в векторные представления, чтобы приблизить качество аудиального восприятия к уровню текстового понимания.

Ключевые факты

  • Исследование проведено специалистами Инженерной школы Витерби при Университете Южной Калифорнии (USC).
  • Модели показали стабильно более высокие показатели точности (на 15–25% выше в зависимости от задачи) при работе с текстом по сравнению с аудио.
  • Основными факторами снижения эффективности в аудио стали акустические помехи и сложность интерпретации невербальных сигналов.
  • Работа указывает на необходимость совершенствования архитектур для обработки естественной речи (ASR) и мультимодальных энкодеров.
  • Исследование акцентирует внимание на рисках использования ИИ в критических сценариях, где важна точность интерпретации устной речи.