Исследователи OpenAI добились трехкратного роста производительности моделей в бенчмарке ARC-AGI-3, изменив всего два параметра конфигурации инференса. Эксперимент показал, что использование специфических стратегий генерации и методов проверки ответов позволяет значительно повысить способность ИИ к решению задач на логическое мышление и абстрактное обобщение, которые ранее считались труднодоступными для стандартных LLM.

Основной фокус исследования был направлен на преодоление ограничений моделей при работе с задачами, требующими многошагового рассуждения. Вместо изменения архитектуры нейросети или проведения дополнительного обучения, команда сфокусировалась на оптимизации процесса генерации и верификации. Это позволило модели эффективнее исследовать пространство возможных решений и отсеивать неверные варианты до финального вывода.

Результаты подчеркивают важность правильной настройки параметров инференса для задач, требующих высокого уровня когнитивных способностей. Данный подход демонстрирует, что текущие модели обладают скрытым потенциалом, который раскрывается через точную настройку процесса взаимодействия с контекстом и структурирование вывода, что критически важно для развития агентных систем, ориентированных на сложные логические операции.

Ключевые факты

  • Использование двух конкретных настроек инференса позволило утроить итоговый балл в бенчмарке ARC-AGI-3.
  • Бенчмарк ARC-AGI-3 ориентирован на оценку способностей ИИ к абстрактному мышлению и решению задач, с которыми модель ранее не сталкивалась.
  • Исследование фокусируется на методах генерации и верификации, а не на дообучении или изменении весов модели.
  • Полученные данные подтверждают, что оптимизация процесса вывода (inference-time compute) является эффективным способом повышения качества ответов без затрат на переобучение.