Исследователи представили PagedWeight — метод управления памятью для эффективного инференса Mixture-of-Experts (MoE) моделей. Технология решает проблему нехватки видеопамяти при одновременной работе с весами модели и растущим KV-кэшем. За счет динамической квантовизации весов в реальном времени PagedWeight позволяет значительно снизить требования к GPU, сохраняя при этом точность генерации на уровне исходных моделей.

Архитектура MoE-моделей обеспечивает высокую производительность, однако требует значительных объемов памяти для хранения всех экспертов. В сценариях с длинным контекстом KV-кэш начинает конкурировать за ресурсы с весами модели, что приводит к замедлению работы или необходимости использования более мощного оборудования. PagedWeight оптимизирует этот процесс, перераспределяя нагрузку на память и позволяя запускать более крупные модели на ограниченном железе.

Метод использует адаптивный подход к квантовизации, который учитывает текущие потребности инференса. Это позволяет динамически изменять точность весов в зависимости от нагрузки, освобождая место для данных кэша без существенной потери качества ответов. Решение ориентировано на инфраструктурные задачи, где критически важна пропускная способность и плотность размещения моделей на серверах.

Ключевые факты

  • PagedWeight снижает конфликт ресурсов между весами MoE-моделей и KV-кэшем при интенсивных нагрузках.
  • Метод применяет динамическую квантовизацию весов, адаптируясь к текущим требованиям инференса.
  • Технология позволяет повысить эффективность использования видеопамяти без деградации качества модели.
  • Решение направлено на оптимизацию развертывания крупных MoE-архитектур в продакшн-средах.