Компания Alibaba выпустила модель Qwen Audio 3.0 TTS Plus, которая заняла первую строчку в рейтинге Speech Arena от Artificial Analysis. Новинка поддерживает 16 языков и позволяет гибко настраивать эмоциональную окраску речи с помощью текстовых описаний или специальных тегов. Несмотря на лидерство по качеству звучания, модель уступает конкурентам в скорости генерации аудиоконтента.

Модель ориентирована на создание естественной и выразительной речи, что делает её востребованной в задачах, где важна интонация и передача эмоций. Пользователи могут управлять стилем произношения, используя простые команды в естественном языке, например, задавая гневный или радостный тон. Это значительно упрощает процесс настройки синтеза для специфических сценариев использования, таких как озвучка видео или интерактивные диалоговые системы.

Однако текущая архитектура модели имеет ограничения по производительности. При скорости 16 символов в секунду Qwen Audio 3.0 TTS Plus работает заметно медленнее, чем аналогичные решения, такие как Sonic 3.5 или Simba 3.2. Разрыв в скорости может стать критическим фактором для приложений, требующих генерации речи в режиме реального времени, где задержка отклика является определяющим параметром для пользовательского опыта.

Ключевые факты

  • Qwen Audio 3.0 TTS Plus заняла первое место в бенчмарке Speech Arena от Artificial Analysis.
  • Модель поддерживает 16 различных языков для синтеза речи.
  • Управление стилем и эмоциями осуществляется через текстовые теги, например [angry].
  • Скорость генерации составляет 16 символов в секунду, что ниже показателей конкурентов Sonic 3.5 и Simba 3.2.