Проект ARC Prize предлагает новый подход к измерению прогресса в создании общего искусственного интеллекта (AGI), фокусируясь на способности моделей к абстрактному мышлению и обобщению. В отличие от стандартных LLM-бенчмарков, основанных на запоминании данных, ARC-AGI тестирует умение решать задачи, с которыми модель ранее не сталкивалась, используя минимум примеров для обучения.

Современные языковые модели демонстрируют высокие результаты в задачах, требующих воспроизведения накопленных знаний, однако они часто пасуют перед логическими головоломками, требующими адаптивного интеллекта. Организаторы конкурса подчеркивают, что текущие архитектуры, основанные на предсказании следующего токена, ограничены в способности к «рассуждению на лету». ARC-AGI призван сместить фокус индустрии с масштабирования вычислительных мощностей на разработку алгоритмов, способных к эффективному обучению в условиях ограниченных данных.

Призовой фонд инициативы составляет 1,1 миллиона долларов, которые распределяются между исследователями, предложившими наиболее эффективные методы решения задач из набора ARC. Участникам предлагается преодолеть порог в 85% точности, что, по мнению авторов, станет важным индикатором приближения к человеческому уровню интеллекта в задачах на логический вывод.

Ключевые факты

  • ARC-AGI состоит из набора задач, требующих от ИИ понимания визуальных концепций и логических правил без предварительного обучения на огромных массивах текста.
  • Призовой фонд конкурса составляет 1,1 миллиона долларов, направленных на стимулирование прорывов в области архитектур общего интеллекта.
  • Целевой показатель точности для участников установлен на уровне 85%, что значительно превышает текущие возможности большинства передовых LLM.
  • Методология бенчмарка исключает возможность «зазубривания» ответов, так как задачи генерируются динамически и требуют от модели построения алгоритма решения в реальном времени.