Исследователи представили WorldCup Arena — новый подход к оценке LLM, исключающий проблему утечки данных из обучающих выборок. В ходе чемпионата мира по футболу 2026 года шесть передовых моделей с доступом к поиску в реальном времени прогнозировали исходы матчей. Это позволило оценить их способность к логическому выводу на основе динамически меняющейся информации, недоступной при статичном обучении.

Традиционные бенчмарки часто страдают от «загрязнения» данных, когда ответы на тестовые вопросы уже содержатся в интернете и были включены в обучающую выборку модели. В данном эксперименте использовались события, которые еще не произошли на момент генерации прогноза. Это создает условия «чистого» тестирования, где модель вынуждена полагаться на актуальные данные и собственные способности к рассуждению, а не на заученные факты из истории.

В тестировании участвовали модели, поддерживающие функции глубокого мышления (extended thinking) и нативную интеграцию с поисковыми системами. Такой подход имитирует реальные сценарии использования ИИ-агентов, которым требуется принимать решения в условиях постоянно обновляющегося потока данных. Результаты эксперимента показывают, насколько эффективно современные архитектуры справляются с анализом текущих событий в режиме реального времени.

Ключевые факты

  • Эксперимент проводился в течение 39 дней во время чемпионата мира по футболу 2026 года.
  • В тестировании приняли участие шесть передовых LLM, оснащенных инструментами для поиска в сети.
  • Методология исключает возможность «запоминания» ответов, так как события оценивались в момент их совершения.
  • Основной акцент сделан на проверке способности моделей к прогнозированию и логическому анализу динамических данных.
  • Исследование направлено на решение проблемы утечки данных в стандартных бенчмарках, основанных на ретроспективных событиях.