Исследователи обнаружили критическую уязвимость в методах оценки сжатых языковых моделей. Несмотря на прохождение стандартных тестов на перплексию, точность MMLU и проверку внутренней репрезентации, оптимизированные модели склонны к галлюцинациям при выполнении многошаговых агентных процедур. Стандартные «дешевые» метрики качества не способны выявить скрытые дефекты логики, возникающие после компрессии нейросетей.

Проблема заключается в том, что текущие инструменты контроля качества ориентированы на статические ответы, а не на последовательное планирование. В ходе экспериментов выяснилось, что даже при сохранении высокой точности на классических бенчмарках, сжатые модели начинают выдумывать несуществующие шаги в алгоритмах выполнения задач. Это создает иллюзию надежности, которая разрушается при реальном использовании агентов в сложных рабочих процессах.

Авторы работы подчеркивают, что существующий стек проверок имеет «слепую зону». Разработчикам, внедряющим квантованные или дистиллированные модели в агентные системы, недостаточно полагаться на внутренние сигналы верности (fidelity signals). Необходимы дополнительные поведенческие тесты, имитирующие агентную среду, чтобы гарантировать корректность выполнения инструкций, а не просто статистическое соответствие исходной модели.

Ключевые факты

  • Сжатые модели успешно проходят тесты на перплексию и MMLU, сохраняя показатели в рамках доверительного интервала.
  • Стандартные методы проверки внутренней репрезентации через случайные зонды (random probes) не выявляют деградацию агентных способностей.
  • Основная проблема сжатых моделей — склонность к генерации вымышленных процедурных шагов в многоэтапных задачах.
  • Исследование указывает на неэффективность «data-free» метрик для оценки безопасности и надежности моделей в агентных сценариях.