Лидерборд ARC-AGI (Abstraction and Reasoning Corpus) стал ключевым инструментом для оценки способности моделей к абстрактному мышлению и решению задач, с которыми они ранее не сталкивались. В отличие от стандартных тестов, основанных на запоминании данных, этот бенчмарк проверяет навыки адаптивного обучения, что делает его одним из самых надежных индикаторов прогресса на пути к созданию общего искусственного интеллекта.

Текущие результаты показывают, что даже самые передовые языковые модели испытывают значительные трудности с задачами ARC, требующими логического вывода и понимания пространственных закономерностей. Участники соревнований используют различные подходы: от дообучения нейросетей на специализированных синтетических данных до внедрения алгоритмов поиска и программного синтеза, которые позволяют моделям «рассуждать» перед выдачей ответа.

Разработчики бенчмарка подчеркивают, что высокие показатели в ARC-AGI коррелируют с реальной способностью системы к обобщению знаний. Это стимулирует исследовательские лаборатории отходить от стратегии простого увеличения количества параметров в пользу разработки архитектур, способных к эффективному планированию и проверке гипотез в условиях ограниченного контекста.

Ключевые факты

  • ARC-AGI был создан Франсуа Шолле для оценки способности ИИ к эффективному приобретению новых навыков.
  • Бенчмарк включает задачи, которые требуют от модели понимания базовых концепций, таких как симметрия, вращение и топология.
  • Лидерборд регулярно обновляется по мере появления новых методов, включая гибридные системы, сочетающие LLM с внешними решателями задач.
  • Текущие лидеры показывают результаты, значительно превышающие базовые показатели моделей GPT-4, однако до уровня человеческого интеллекта в решении данных задач остается существенный разрыв.