Разработчики представили QaDiT — диффузионную модель (DiT) для генерации аудио, насчитывающую 160 миллионов параметров. Ключевой особенностью проекта стала оптимизация архитектуры, позволяющая проводить дообучение и инференс на обычном потребительском оборудовании. Модель демонстрирует высокую эффективность синтеза звука при минимальных требованиях к вычислительным мощностям, что снижает порог входа для создания специализированных аудио-решений.

Архитектура QaDiT основана на принципах диффузионных трансформеров, которые в последнее время показывают лучшие результаты в задачах генерации медиаконтента по сравнению с традиционными методами. Использование 160 млн параметров делает модель достаточно легкой для развертывания в локальных средах, где использование крупных облачных кластеров экономически нецелесообразно или технически ограничено.

Этот релиз ориентирован на исследователей и разработчиков, которым требуется гибкий инструмент для генерации звуковых эффектов или речи без необходимости аренды дорогостоящих GPU-ферм. Проект доступен в открытом доступе на платформе Hugging Face, что позволяет сообществу проводить собственные эксперименты по дообучению на специфических аудио-датасетах.

Ключевые факты

  • Размер модели составляет 160 миллионов параметров.
  • Архитектура построена на базе диффузионных трансформеров (DiT).
  • Модель оптимизирована для работы на потребительских видеокартах.
  • Исходный код и веса модели опубликованы в репозитории на Hugging Face.
  • Решение предназначено для задач text-to-audio, обеспечивая баланс между качеством синтеза и вычислительной сложностью.