Исследователи провели независимую проверку математических навыков передовых языковых моделей, выявив значительные расхождения между заявленными результатами и реальной производительностью. Анализ показал, что многие модели демонстрируют признаки «заучивания» тестовых наборов данных, что приводит к завышению метрик точности при решении сложных задач, требующих глубокого логического вывода, а не простого воспроизведения паттернов из обучающей выборки.

Проблема загрязнения данных (data contamination) становится критическим фактором для оценки прогресса в области ИИ. Когда тестовые задачи попадают в обучающую выборку, модели показывают впечатляющие результаты на бенчмарках, но теряют эффективность при столкновении с уникальными, ранее не встречавшимися математическими проблемами. Это ставит под сомнение надежность текущих лидербордов как индикаторов реального интеллекта систем.

Эксперты подчеркивают необходимость перехода к динамическим методам тестирования, где задачи генерируются алгоритмически или требуют многошагового доказательства, которое невозможно найти в открытом доступе. Только такой подход позволяет объективно измерить способность модели к абстрактному мышлению и математическому анализу, исключая влияние эффекта памяти.

Ключевые факты

  • Выявлено существенное влияние загрязнения данных на итоговые баллы в математических бенчмарках.
  • Модели показывают резкое снижение точности при изменении формулировок задач, которые ранее входили в обучающие сеты.
  • Текущие методы оценки переоценивают способности LLM к решению задач олимпиадного уровня сложности.
  • Рекомендуется внедрение закрытых тестовых наборов данных для более точного измерения прогресса в логических рассуждениях.