Разработчики представили 2-битную квантованную версию модели Qwen3.6-35B-A3B, которая демонстрирует практически полное сохранение точности на уровне формата FP8. Использование экстремального сжатия до 2 бит на параметр позволяет значительно снизить требования к видеопамяти при запуске крупных языковых моделей, делая их доступными для работы на потребительском оборудовании без существенной потери качества генерации ответов.
Технология квантования до 2 бит открывает возможности для инференса моделей с десятками миллиардов параметров на GPU с ограниченным объемом VRAM. Это критически важно для локального запуска агентных систем, где требуется высокая производительность при минимальных затратах на инфраструктуру. Метод позволяет упаковать модель весом 35B в компактный объем, сохраняя при этом логические способности оригинальной архитектуры.
Данный релиз является важным шагом в оптимизации инференса, так как преодолевает барьер между качеством «тяжелых» моделей и доступностью «легких» решений. Снижение веса модели до 2 бит радикально меняет требования к пропускной способности памяти, что ускоряет генерацию токенов и упрощает развертывание сложных ИИ-агентов в локальных средах.
Ключевые факты
- Модель Qwen3.6-35B-A3B сжата до 2 бит на параметр.
- Уровень точности соответствует формату FP8, что минимизирует деградацию ответов.
- Решение оптимизировано для снижения нагрузки на VRAM при сохранении 35 миллиардов параметров.
- Модель доступна для использования в сообществе через платформу Hugging Face.