Исследователи представили WorldCup Arena — новый подход к оценке LLM, исключающий проблему утечки данных из обучающих выборок. В ходе чемпионата мира по футболу 2026 года шесть передовых моделей с доступом к поиску в реальном времени прогнозировали исходы матчей. Это позволило оценить их способность к логическому выводу на основе динамически меняющейся информации, недоступной при статичном обучении.
Традиционные бенчмарки часто страдают от «загрязнения» данных, когда ответы на тестовые вопросы уже содержатся в интернете и были включены в обучающую выборку модели. В данном эксперименте использовались события, которые еще не произошли на момент генерации прогноза. Это создает условия «чистого» тестирования, где модель вынуждена полагаться на актуальные данные и собственные способности к рассуждению, а не на заученные факты из истории.
В тестировании участвовали модели, поддерживающие функции глубокого мышления (extended thinking) и нативную интеграцию с поисковыми системами. Такой подход имитирует реальные сценарии использования ИИ-агентов, которым требуется принимать решения в условиях постоянно обновляющегося потока данных. Результаты эксперимента показывают, насколько эффективно современные архитектуры справляются с анализом текущих событий в режиме реального времени.
Ключевые факты
- Эксперимент проводился в течение 39 дней во время чемпионата мира по футболу 2026 года.
- В тестировании приняли участие шесть передовых LLM, оснащенных инструментами для поиска в сети.
- Методология исключает возможность «запоминания» ответов, так как события оценивались в момент их совершения.
- Основной акцент сделан на проверке способности моделей к прогнозированию и логическому анализу динамических данных.
- Исследование направлено на решение проблемы утечки данных в стандартных бенчмарках, основанных на ретроспективных событиях.