Лаборатория Tongyi компании Alibaba выпустила Qwen-Audio-3.0-TTS — специализированную систему синтеза речи, доступную через облачную платформу Model Studio. Модель представлена в двух версиях: Flash для задач с минимальной задержкой и Plus для высококачественного озвучивания. Решение поддерживает 16 языков и ориентировано на интеграцию в производственные среды, требующие стабильной работы с аудиоконтентом.
Система разработана для решения типичных проблем при внедрении TTS-технологий, включая естественность интонаций и скорость отклика. Версия Flash оптимизирована для сценариев интерактивного общения, где критически важна мгновенная реакция ИИ. В свою очередь, вариант Plus предназначен для создания контента, требующего высокого качества звучания и выразительности, что делает модель пригодной для широкого спектра бизнес-задач, от автоматизированных колл-центров до создания медиаконтента.
Модели распространяются исключительно как API-сервисы через облачную инфраструктуру Alibaba Cloud. Такой подход позволяет разработчикам использовать возможности генерации речи без необходимости развертывания тяжелых весов на собственной инфраструктуре, обеспечивая масштабируемость и простоту интеграции в существующие программные продукты.
Ключевые факты
- Модель поддерживает 16 различных языков для глобального охвата.
- Доступны две версии: Flash (акцент на скорость) и Plus (акцент на качество).
- Сервис предоставляется через облачную платформу Alibaba Cloud Model Studio.
- Релиз ориентирован на производственные задачи, требующие высокой стабильности и низкой задержки.
- Модель не распространяется в виде скачиваемых весов, доступ возможен только через облачный хостинг.
