Исследователи представили метод GPTQ-2D, который оптимизирует процесс квантования весов LLM. В отличие от классического алгоритма GPTQ, работающего с односторонним округлением, новый подход применяет двухстороннее адаптивное округление с использованием базисных матриц. Это позволяет эффективнее минимизировать квадратичную ошибку при переводе весов модели в целочисленный формат, сохраняя точность при высокой степени сжатия.
Традиционные методы квантования, такие как GPTQ, обрабатывают элементы матрицы последовательно, передавая ошибку округления через треугольную матрицу обратной связи. Метод GPTQ-2D расширяет эту концепцию, вводя невырожденные базисные матрицы, которые действуют с обеих сторон весовой матрицы. Такой подход обеспечивает более гибкую настройку параметров и позволяет точнее аппроксимировать исходные веса в условиях ограниченных вычислительных ресурсов.
Разработка направлена на решение проблемы деградации качества моделей при их квантовании до низких битовых представлений. Использование двухстороннего подхода позволяет лучше учитывать взаимосвязи между весами, что критически важно для сохранения производительности больших языковых моделей при их запуске на потребительском «железе» или специализированных ускорителях с поддержкой целочисленных операций.
Ключевые факты
- Метод GPTQ-2D основан на двухстороннем адаптивном округлении весовых матриц.
- Алгоритм использует невырожденные базисные матрицы для минимизации ошибки квантования.
- Метод является развитием классического алгоритма GPTQ, который эквивалентен алгоритму ближайшей плоскости Бабая.
- Технология позволяет повысить точность сжатых моделей за счет более эффективного распределения ошибок округления.