Исследователи представили MixFrag — новый метод квантования после обучения (PTQ) для Vision Transformers (ViT). В отличие от стандартных подходов с фиксированной битностью, MixFrag анализирует чувствительность различных компонентов модели к потере точности. Это позволяет динамически распределять битовую глубину, сохраняя высокую производительность нейросетей при их развертывании на устройствах с ограниченными вычислительными ресурсами.
Традиционные методы квантования часто применяют одинаковую точность ко всем слоям трансформера, что приводит к избыточному потреблению ресурсов или неоправданному падению качества. MixFrag использует метрику «хрупкости» (fragility), которая определяет, насколько сильно конкретный блок или слой модели реагирует на сжатие. На основе этих данных алгоритм подбирает оптимальный формат для каждого компонента, обеспечивая баланс между скоростью инференса и точностью предсказаний.
Данный подход особенно актуален для внедрения тяжелых моделей компьютерного зрения в edge-устройства, такие как смартфоны или встраиваемые системы. Метод позволяет значительно снизить объем памяти и требования к пропускной способности без необходимости полноценного дообучения модели (fine-tuning), что сокращает время подготовки нейросетей к эксплуатации в реальных условиях.
Ключевые факты
- MixFrag фокусируется на гетерогенной чувствительности компонентов Vision Transformers к квантованию.
- Метод заменяет равномерное распределение бит на адаптивное, исходя из оценки «хрупкости» слоев.
- Технология предназначена для оптимизации моделей в условиях ограниченных аппаратных ресурсов.
- Подход относится к категории Post-training quantization (PTQ), не требующей повторного обучения весов.