Исследователи представили унифицированную архитектуру для создания полноценных музыкальных треков, объединяющую иерархическое авторегрессионное планирование и метод flow-matching. Система позволяет генерировать качественные композиции на основе текстовых описаний, заданных лирических текстов и специфических музыкальных атрибутов, поддерживая как создание песен с вокалом, так и чисто инструментальных произведений с высокой степенью контроля над структурой.

Ключевая особенность предложенного метода заключается в разделении процесса генерации на этапы планирования и рендеринга. Сначала модель выстраивает общую структуру композиции, определяя последовательность музыкальных событий, после чего механизм flow-matching преобразует этот план в финальный аудиосигнал. Такой подход решает проблему потери связности в длинных аудиофрагментах, характерную для стандартных моделей, работающих с сырыми аудиоданными.

Разработка демонстрирует значительный прогресс в области генеративного аудио, позволяя пользователям задавать сложные параметры, такие как жанр, темп и настроение, сохраняя при этом логическую целостность трека от начала до конца. Технология открывает новые возможности для автоматизации создания саундтреков и музыкального контента, где требуется точное соответствие заданному тексту или эмоциональному контексту.

Ключевые факты

  • Метод объединяет иерархическое авторегрессионное планирование с технологией flow-matching для повышения качества аудио.
  • Система поддерживает три основных режима работы: генерация песни из текста и лирики, создание инструментальных треков и управление музыкальными атрибутами.
  • Архитектура решает проблему долгосрочной связности, разделяя высокоуровневое планирование структуры композиции и низкоуровневый рендеринг звука.
  • Модель способна генерировать полноценные по длительности музыкальные произведения, сохраняя стилистическое единство на протяжении всего трека.