Библиотека Diffusers теперь поддерживает метод Nunchaku, позволяющий выполнять инференс диффузионных моделей в 4-битном квантовании. Это решение существенно снижает требования к видеопамяти при сохранении высокого качества генерации изображений. Интеграция упрощает развертывание тяжелых моделей на потребительском оборудовании, делая процесс генерации более доступным и эффективным для локальных сред и агентных систем.
Метод Nunchaku основан на технике квантования весов, которая минимизирует потери точности при сжатии модели до 4 бит. В отличие от стандартных подходов, этот метод оптимизирован специально для архитектур диффузионных моделей, что позволяет достичь баланса между скоростью работы и визуальным качеством выходных данных. Разработчики могут использовать этот инструмент для ускорения пайплайнов генерации контента без необходимости в дорогостоящих серверных GPU.
Поддержка в Diffusers реализована через интеграцию с библиотекой `optimum-quanto`, что обеспечивает бесшовную работу с существующими весами моделей. Пользователи могут применять квантование как к базовым моделям, так и к их дообученным версиям (LoRA), что расширяет возможности кастомизации при ограниченных аппаратных ресурсах. Это обновление является важным шагом для оптимизации инференса в реальном времени.
Ключевые факты
- Метод Nunchaku обеспечивает 4-битное квантование весов для диффузионных моделей, снижая потребление VRAM.
- Интеграция реализована в библиотеке Diffusers с использованием инструментов `optimum-quanto`.
- Технология позволяет запускать сложные генеративные модели на видеокартах с меньшим объемом памяти без существенной деградации качества.
- Поддерживается работа с LoRA-адаптерами, что сохраняет гибкость настройки моделей после квантования.