Исследователи представили метод Parallel Decoding Distillation (PDD), направленный на радикальное ускорение генерации изображений и видео. Технология позволяет сократить количество итераций при сэмплировании в диффузионных и потоковых моделях, сохраняя при этом высокое визуальное качество. Новый подход решает проблему вычислительной сложности, характерную для современных генеративных моделей, за счет оптимизации процесса обучения и перехода к многошаговой генерации с меньшими затратами ресурсов.

Традиционные методы ускорения, такие как вариационная дистилляция оценок (VSD) и состязательные потери, часто сталкиваются с нестабильностью обучения и сложностью настройки гиперпараметров. Авторы работы предлагают альтернативный путь, который упрощает процесс дистилляции диффузионных моделей в генераторы с малым числом шагов. Это позволяет значительно сократить время инференса без существенной потери детализации и временной согласованности видеопотока.

Метод ориентирован на устранение «узкого горлышка» в виде итеративного процесса сэмплирования, который является основным препятствием для внедрения генеративного видео в реальное время. Предложенная архитектура демонстрирует эффективность на стандартных бенчмарках, обеспечивая баланс между скоростью вычислений и качеством синтезируемого контента.

Ключевые факты

  • Метод Parallel Decoding Distillation (PDD) снижает вычислительные затраты при генерации видео и изображений.
  • Технология направлена на замену сложных методов обучения, основанных на вариационной дистилляции оценок (VSD).
  • Новый подход позволяет трансформировать тяжелые диффузионные модели в быстрые генераторы с малым количеством шагов.
  • Решение повышает стабильность обучения моделей по сравнению с использованием исключительно состязательных функций потерь.