Лаборатория Tongyi компании Alibaba выпустила Qwen-Audio-3.0-TTS — специализированную систему синтеза речи, доступную через облачную платформу Model Studio. Модель представлена в двух версиях: Flash для задач с минимальной задержкой и Plus для высококачественного озвучивания. Решение поддерживает 16 языков и ориентировано на интеграцию в производственные среды, требующие стабильной работы с аудиоконтентом.

Система разработана для решения типичных проблем при внедрении TTS-технологий, включая естественность интонаций и скорость отклика. Версия Flash оптимизирована для сценариев интерактивного общения, где критически важна мгновенная реакция ИИ. В свою очередь, вариант Plus предназначен для создания контента, требующего высокого качества звучания и выразительности, что делает модель пригодной для широкого спектра бизнес-задач, от автоматизированных колл-центров до создания медиаконтента.

Модели распространяются исключительно как API-сервисы через облачную инфраструктуру Alibaba Cloud. Такой подход позволяет разработчикам использовать возможности генерации речи без необходимости развертывания тяжелых весов на собственной инфраструктуре, обеспечивая масштабируемость и простоту интеграции в существующие программные продукты.

Ключевые факты

  • Модель поддерживает 16 различных языков для глобального охвата.
  • Доступны две версии: Flash (акцент на скорость) и Plus (акцент на качество).
  • Сервис предоставляется через облачную платформу Alibaba Cloud Model Studio.
  • Релиз ориентирован на производственные задачи, требующие высокой стабильности и низкой задержки.
  • Модель не распространяется в виде скачиваемых весов, доступ возможен только через облачный хостинг.