Опубликован детальный разбор работы модели Qwen 3.6 35B MoE на потребительском железе. Несмотря на 35 миллиардов параметров, архитектура Mixture-of-Experts позволяет задействовать лишь 3 миллиарда активных параметров на токен. Тесты на видеокарте RTX 3090 с 24 ГБ видеопамяти демонстрируют высокую скорость генерации и эффективность использования ресурсов при локальном запуске современных LLM.
Использование MoE-архитектур становится ключевым методом для запуска мощных моделей на домашнем оборудовании. В данном случае модель демонстрирует баланс между качеством ответов, характерным для тяжелых моделей, и скоростью инференса, доступной для систем с ограниченным объемом VRAM. Автор анализирует не только скорость генерации токенов в секунду, но и влияние квантования на итоговую точность модели.
Результаты показывают, что при правильной оптимизации весов и использовании эффективных библиотек инференса, современные MoE-модели среднего размера способны работать в реальном времени на GPU предыдущих поколений. Это открывает возможности для локального развертывания сложных агентных систем без необходимости аренды дорогостоящих серверных мощностей.
Ключевые факты
- Модель Qwen 3.6 35B MoE использует архитектуру с 3 миллиардами активных параметров на каждый токен.
- Тестирование проводилось на видеокарте NVIDIA RTX 3090, оснащенной 24 ГБ видеопамяти.
- Анализ подтверждает возможность комфортной работы с моделью при использовании методов квантования.
- Исследование фокусируется на показателях скорости генерации токенов и потреблении ресурсов VRAM в процессе инференса.