Исследователи представили AURORA-LM — архитектуру, которая переносит принципы диффузионных моделей из работы с изображениями и аудио в область обработки естественного языка. В отличие от традиционных LLM, работающих с дискретными токенами, модель использует непрерывные латентные представления, что позволяет преодолеть ограничения существующих методов сжатия и повысить качество генерации текста за счет более эффективного декодирования.

Традиционные языковые модели опираются на дискретные токены, что создает разрыв между методами генерации текста и мультимодальными моделями, работающими в непрерывных пространствах. Существующие попытки адаптации диффузионных моделей для текста часто сталкиваются с потерей точности на уровне отдельных токенов или требуют сложных схем сжатия, которые негативно влияют на связность и логику генерируемого контента.

AURORA-LM предлагает унифицированный подход к автокодированию и диффузии, позволяя модели обучаться в пространстве, специально оптимизированном для совместной генерации и декодирования. Это решение минимизирует артефакты, возникающие при переходе от латентного представления к текстовому выводу, и открывает путь к созданию более гибких генеративных систем, способных работать с текстом как с непрерывным сигналом.

Ключевые факты

  • AURORA-LM использует непрерывные латентные пространства для генерации текста, отказываясь от классической дискретизации токенов.
  • Архитектура решает проблему несовместимости пространств эмбеддингов, характерную для предыдущих попыток внедрения диффузионных моделей в NLP.
  • Метод направлен на устранение потерь информации, возникающих при сжатии данных в автокодировщиках для последующей диффузии.
  • Разработка позволяет интегрировать текстовые модели в единые конвейеры с генераторами изображений и аудио, использующими схожие принципы латентной диффузии.