Исследование влияния квантования на производительность LLM показывает, что снижение точности весов приводит к нелинейной потере знаний. Анализ модели Qwen2.5 72B выявил, что при переходе к низким битовым форматам (4-bit и ниже) модель начинает терять специфические фактологические данные быстрее, чем общие способности к рассуждению, что критично для RAG-систем и специализированных бизнес-приложений.

Авторы работы проанализировали, как различные методы сжатия влияют на способность модели извлекать точную информацию из своих внутренних весов. Выяснилось, что деградация знаний происходит неравномерно: некоторые области знаний «стираются» значительно раньше других при одинаковом уровне квантования. Это создает риски для компаний, использующих сжатые модели для задач, требующих высокой фактологической точности, так как стандартные бенчмарки на логику могут не отражать реальную потерю экспертных данных.

Результаты подчеркивают необходимость тщательного тестирования моделей после квантования, особенно в сценариях, где модель выступает в роли базы знаний. Использование методов сжатия требует баланса между экономией ресурсов и сохранением критически важной информации, так как даже незначительное снижение точности весов может привести к галлюцинациям в специфических доменах.

Ключевые факты

  • Исследование сфокусировано на модели Qwen2.5 72B, демонстрирующей нелинейную потерю знаний при квантовании.
  • При переходе к форматам ниже 4-bit наблюдается резкое падение фактологической точности, опережающее снижение общих когнитивных способностей.
  • Квантование неравномерно затрагивает различные пласты знаний, что делает поведение модели непредсказуемым в узкоспециализированных задачах.
  • Авторы рекомендуют проводить стресс-тестирование моделей на специфических для бизнеса данных после применения методов сжатия.