Команда Unsloth представила оптимизированную версию модели Kimi K3 в формате GGUF, значительно снизив требования к объему памяти. Благодаря методам сжатия размер весов модели был сокращен с 1,56 ТБ до 594 ГБ. Это решение делает запуск крупномасштабных языковых моделей более доступным для локальных инфраструктур, сохраняя при этом производительность, характерную для оригинальной архитектуры Kimi.
Технология сжатия GGUF (GPT-Generated Unified Format) позволяет эффективно использовать квантование, что критически важно для работы с моделями такого масштаба на потребительском или специализированном серверном оборудовании. Уменьшение объема данных в 2,6 раза упрощает процесс развертывания, снижая требования к пропускной способности дисковой подсистемы и объему оперативной памяти, необходимой для загрузки весов.
Данный релиз ориентирован на разработчиков и исследователей, работающих с локальными LLM, которым требуется высокая точность при ограниченных аппаратных ресурсах. Использование инструментов Unsloth позволяет интегрировать подобные модели в собственные пайплайны инференса без потери качества, обеспечивая при этом более высокую скорость инициализации и оптимизированное потребление ресурсов при выполнении задач.
Ключевые факты
- Исходный размер модели Kimi K3 составлял 1,56 ТБ.
- После оптимизации с помощью Unsloth размер сократился до 594 ГБ.
- Модель представлена в формате GGUF для обеспечения совместимости с популярными движками инференса.
- Оптимизация позволяет запускать модель на менее требовательных конфигурациях оборудования без существенной потери точности.