Исследователи проанализировали эффективность автоматических систем оценки синтеза речи (TTS), включая предикторы MOS и аудио-LLM. Выяснилось, что текущие модели часто не справляются с оценкой специфических лингвистических аспектов, на которые ориентируются люди. Авторы предложили новую схему аннотирования из 10 параметров, позволяющую более точно сопоставлять машинные оценки с реальным человеческим восприятием качества аудио.
Современные подходы к оценке TTS-систем часто сводят качество к единому показателю «естественности», что скрывает критические недостатки в интонации, артикуляции и просодии. Использование Audio-LLM в качестве судей стало популярным трендом, однако их способность к глубокому лингвистическому анализу остается под вопросом. Работа показывает, что без декомпозиции аудио на конкретные перцептивные признаки автоматические метрики не могут полноценно заменить экспертную оценку.
Новая методология разделяет восприятие речи на 10 независимых измерений, что позволяет выявлять ошибки, которые игнорируются стандартными алгоритмами. Это дает разработчикам возможность точечно настраивать модели синтеза, понимая, какой именно аспект речи — например, ритмика или эмоциональная окраска — требует доработки. Исследование подчеркивает необходимость перехода от обобщенных метрик к многофакторному анализу в задачах генерации аудио.
Ключевые факты
- Предложена новая схема аннотирования, включающая 10 лингвистически обоснованных параметров восприятия речи.
- Проведен сравнительный анализ классических предикторов MOS и современных аудио-ориентированных больших языковых моделей.
- Выявлено существенное расхождение между оценками нейросетевых судей и реальным восприятием слушателей по узкоспециализированным лингвистическим критериям.
- Результаты работы позволяют повысить точность автоматизированных пайплайнов тестирования TTS-систем в продакшене.