Представлена Audio8 TTS Preview 0.6B — новая компактная модель для синтеза речи, поддерживающая мультиязычность и функцию zero-shot клонирования голоса. При объеме параметров всего 0,6 миллиарда модель демонстрирует высокую эффективность в генерации естественного звучания, позволяя воспроизводить тембр и интонации целевого спикера на основе короткого аудиофрагмента без необходимости дополнительного обучения.
Разработка ориентирована на сценарии, где требуется низкое потребление вычислительных ресурсов при сохранении высокого качества синтеза. Использование архитектуры с 0,6 млрд параметров делает модель пригодной для запуска на устройствах с ограниченной мощностью, что расширяет возможности внедрения технологий клонирования голоса в мобильные приложения и локальные сервисы обработки аудио.
Технология zero-shot клонирования позволяет системе адаптироваться к новому голосу «на лету», используя лишь несколько секунд исходного аудиозаписи. Это значительно упрощает создание персонализированных голосовых интерфейсов и автоматизированных систем озвучивания контента, исключая длительные этапы подготовки датасетов для дообучения нейросетей под конкретного пользователя.
Ключевые факты
- Модель содержит 0,6 миллиарда параметров, что обеспечивает высокую скорость инференса.
- Реализована поддержка функции zero-shot voice cloning для мгновенного копирования тембра.
- Архитектура поддерживает мультиязычный синтез речи.
- Модель доступна для ознакомления и тестирования на платформе Hugging Face.