Исследователи представили PagedWeight — метод управления памятью для эффективного инференса Mixture-of-Experts (MoE) моделей. Технология решает проблему нехватки видеопамяти при одновременной работе с весами модели и растущим KV-кэшем. За счет динамической квантовизации весов в реальном времени PagedWeight позволяет значительно снизить требования к GPU, сохраняя при этом точность генерации на уровне исходных моделей.
Архитектура MoE-моделей обеспечивает высокую производительность, однако требует значительных объемов памяти для хранения всех экспертов. В сценариях с длинным контекстом KV-кэш начинает конкурировать за ресурсы с весами модели, что приводит к замедлению работы или необходимости использования более мощного оборудования. PagedWeight оптимизирует этот процесс, перераспределяя нагрузку на память и позволяя запускать более крупные модели на ограниченном железе.
Метод использует адаптивный подход к квантовизации, который учитывает текущие потребности инференса. Это позволяет динамически изменять точность весов в зависимости от нагрузки, освобождая место для данных кэша без существенной потери качества ответов. Решение ориентировано на инфраструктурные задачи, где критически важна пропускная способность и плотность размещения моделей на серверах.
Ключевые факты
- PagedWeight снижает конфликт ресурсов между весами MoE-моделей и KV-кэшем при интенсивных нагрузках.
- Метод применяет динамическую квантовизацию весов, адаптируясь к текущим требованиям инференса.
- Технология позволяет повысить эффективность использования видеопамяти без деградации качества модели.
- Решение направлено на оптимизацию развертывания крупных MoE-архитектур в продакшн-средах.