Разработчик обнаружил, что заявленная 4-битная квантованная модель на практике требует 6,2 бита на параметр. Ошибка возникла из-за особенностей реализации формата GGUF и использования метаданных, которые значительно увеличили итоговый объем файла. Этот кейс подчеркивает важность учета накладных расходов при оптимизации моделей для запуска на локальном железе с ограниченными ресурсами памяти.

Проблема проявилась при попытке оптимизировать модель для работы на потребительских GPU. Стандартные инструменты квантования часто фокусируются на сжатии самих весов, но игнорируют дополнительные структуры данных, такие как таблицы поиска (lookup tables) и заголовки, которые в совокупности могут занимать существенный объем. В результате модель, которая теоретически должна была весить значительно меньше, оказалась слишком тяжелой для целевого устройства.

Автор статьи детально разобрал структуру файлов GGUF и показал, как именно происходит «раздувание» весов. Оказалось, что при использовании определенных методов квантования, где каждый блок весов требует индивидуальных коэффициентов масштабирования и смещения, итоговый размер данных на диск и в оперативной памяти превышает математический минимум. Это критический нюанс для инженеров, занимающихся деплоем LLM на edge-устройствах.

Ключевые факты

  • Теоретическая плотность 4-битного квантования была превышена на 55%, достигнув 6,2 бита на вес.
  • Основной причиной роста объема стали дополнительные метаданные и параметры масштабирования внутри формата GGUF.
  • Исследование демонстрирует, что при расчете требований к VRAM необходимо учитывать не только количество параметров, но и архитектурные накладные расходы формата хранения.
  • Анализ показал, что для эффективного инференса на локальных системах недостаточно просто выбрать метод квантования, нужно проверять реальный размер загружаемых в память данных.