Исследователи проанализировали феномен «насыщения» популярных бенчмарков, при котором модели достигают результатов, близких к человеческим или теоретическим максимумам. Систематическое изучение показало, что текущие метрики теряют способность дифференцировать возможности новых архитектур. Это создает иллюзию замедления прогресса в области ИИ, хотя реальные способности систем продолжают эволюционировать в направлениях, не охваченных стандартными тестами.

Авторы работы подчеркивают, что многие классические наборы данных, используемые для оценки LLM, страдают от «загрязнения» обучающих выборок и недостаточной сложности задач. Когда модель показывает точность, близкую к 100%, тест перестает быть инструментом измерения интеллекта и превращается в проверку на запоминание ответов. Это вынуждает индустрию пересматривать подходы к валидации моделей, смещая фокус с простых ответов на выбор варианта к оценке многошагового рассуждения и динамическим средам.

Для решения проблемы предлагается переход к более сложным, адаптивным бенчмаркам, которые невозможно «зазубрить» в процессе обучения. Исследование указывает на необходимость разработки метрик, оценивающих не только финальный результат, но и процесс генерации решения, а также устойчивость моделей к незначительным изменениям входных данных. Без обновления методологии оценки отрасль рискует оказаться в ситуации, где прогресс моделей опережает возможности инструментов для их измерения.

Ключевые факты

  • Исследование выявило, что большинство популярных бенчмарков достигли «плато насыщения», где разница между топовыми моделями становится статистически незначимой.
  • Одной из главных причин деградации метрик названо попадание тестовых вопросов в обучающие выборки (data contamination).
  • Авторы предлагают внедрить динамические бенчмарки, которые генерируют задачи в реальном времени, исключая возможность предварительного заучивания ответов.
  • Статистический анализ показал, что текущие тесты не учитывают когнитивную нагрузку и логическую глубину, требуемую для решения современных прикладных задач.