Исследователи представили метод Agogic, оптимизирующий представление музыкальных данных для LLM. Авторы проанализировали влияние семи различных способов токенизации на качество генерации музыки, зафиксировав архитектуру модели Qwen3.5, объем обучающих данных и вычислительный бюджет. Результаты показывают, что выбор способа представления музыкальных символов критически влияет на итоговую производительность модели, задавая теоретический предел её возможностей.

Традиционно выбор токенизации в музыкальных нейросетях был тесно связан с архитектурой конкретной модели, что затрудняло объективную оценку эффективности различных подходов. В данной работе исследователи изолировали фактор токенизации, чтобы понять, как именно структура музыкальных токенов определяет способность модели к генерации сложных композиций. Эксперименты проводились на линейке моделей Qwen3.5 с количеством параметров от 0,8 до 27 миллиардов.

Авторы ввели метрику «текстурного потолка» (model-free ceiling), которая позволяет оценить качество представления данных независимо от весов нейросети. Это дает возможность разработчикам выбирать оптимальный способ кодирования музыки еще до начала обучения, основываясь на математических свойствах самой репрезентации, а не на методе проб и ошибок при подборе гиперпараметров.

Ключевые факты

  • Исследование сфокусировано на сравнении семи различных способов токенизации музыкальных данных для LLM.
  • В качестве базовой архитектуры для тестов использовалась серия моделей Qwen3.5 с параметрами от 0,8B до 27B.
  • Введена метрика «текстурного потолка» для оценки эффективности токенизации без учета влияния весов модели.
  • Работа доказывает, что способ представления музыкальных символов является определяющим фактором для качества генерации, превосходящим по значимости многие параметры обучения.