Исследователи представили архитектуру MMOE (Modernizing Diffusion Transformers with Efficient Expert Design), направленную на оптимизацию диффузионных трансформеров. В отличие от существующих решений, которые увеличивают количество параметров без контроля затрат, MMOE внедряет механизмы эффективного использования экспертов. Это позволяет масштабировать модели, сохраняя вычислительную стоимость инференса на низком уровне при значительном росте общей емкости системы.

Современные генеративные модели на базе диффузионных трансформеров часто сталкиваются с проблемой избыточного потребления ресурсов при масштабировании. Авторы работы адаптировали принципы разреженных экспертов (sparse experts), характерные для больших языковых моделей, специально для задач генерации изображений и видео. Новый подход позволяет динамически распределять вычислительную нагрузку, минимизируя количество активных параметров на каждый обрабатываемый токен.

Внедрение такой архитектуры решает проблему «раздувания» моделей, делая их более пригодными для практического развертывания в продакшене. Оптимизация структуры экспертов позволяет достичь высокой производительности без необходимости пропорционального увеличения аппаратных мощностей, что критически важно для высоконагруженных систем генеративного ИИ.

Ключевые факты

  • Архитектура MMOE оптимизирует работу диффузионных трансформеров через эффективное управление экспертами.
  • Метод заимствует принципы разреженности из архитектур больших языковых моделей для снижения стоимости инференса.
  • Решение позволяет масштабировать общую емкость модели без линейного роста вычислительных затрат на каждый токен.
  • Подход направлен на устранение неэффективности текущих моделей, которые увеличивают количество параметров без оптимизации механизмов доступа к ним.