Разработчики представили QaDiT — диффузионную модель (DiT) для генерации аудио, насчитывающую 160 миллионов параметров. Ключевой особенностью проекта стала оптимизация архитектуры, позволяющая проводить дообучение и инференс на обычном потребительском оборудовании. Модель демонстрирует высокую эффективность синтеза звука при минимальных требованиях к вычислительным мощностям, что снижает порог входа для создания специализированных аудио-решений.
Архитектура QaDiT основана на принципах диффузионных трансформеров, которые в последнее время показывают лучшие результаты в задачах генерации медиаконтента по сравнению с традиционными методами. Использование 160 млн параметров делает модель достаточно легкой для развертывания в локальных средах, где использование крупных облачных кластеров экономически нецелесообразно или технически ограничено.
Этот релиз ориентирован на исследователей и разработчиков, которым требуется гибкий инструмент для генерации звуковых эффектов или речи без необходимости аренды дорогостоящих GPU-ферм. Проект доступен в открытом доступе на платформе Hugging Face, что позволяет сообществу проводить собственные эксперименты по дообучению на специфических аудио-датасетах.
Ключевые факты
- Размер модели составляет 160 миллионов параметров.
- Архитектура построена на базе диффузионных трансформеров (DiT).
- Модель оптимизирована для работы на потребительских видеокартах.
- Исходный код и веса модели опубликованы в репозитории на Hugging Face.
- Решение предназначено для задач text-to-audio, обеспечивая баланс между качеством синтеза и вычислительной сложностью.