Исследователи обнаружили, что методы сжатия LLM, такие как квантование и прунинг, позволяют моделям сохранять высокую точность на стандартных бенчмарках, но при этом провоцируют рост галлюцинаций. Даже при прохождении автоматических проверок качества сжатые модели начинают чаще выдумывать факты, что ставит под сомнение надежность оптимизированных систем в критических сценариях использования.
В ходе эксперимента авторы проанализировали, как различные техники компрессии влияют на внутренние представления знаний в нейросетях. Выяснилось, что при уменьшении объема параметров модель может сохранять способность правильно отвечать на простые вопросы, но теряет устойчивость при генерации сложных логических выводов. Это создает «иллюзию безопасности»: система выглядит работоспособной по метрикам, но фактически становится менее предсказуемой.
Проблема заключается в том, что текущие методы оценки качества моделей часто фокусируются на воспроизведении обучающей выборки, а не на фактической достоверности ответов. В условиях ограниченных ресурсов разработчики стремятся максимально сжать модели, однако это приводит к деградации способности нейросети различать истинные данные и вероятностные домыслы. Исследование подчеркивает необходимость разработки новых протоколов тестирования для оптимизированных моделей.
Ключевые факты
- Исследование показало, что сжатые модели успешно проходят стандартные тесты на точность, но демонстрируют значительный рост фактических ошибок.
- Механизмы квантования и прунинга нарушают внутреннюю структуру знаний модели, что ведет к «галлюцинациям» даже при высокой статистической точности.
- Авторы работы призывают пересмотреть подходы к валидации сжатых LLM, так как существующие бенчмарки не учитывают риск генерации ложной информации.
- Результаты указывают на критический разрыв между технической оптимизацией модели и её надежностью в реальных бизнес-задачах.