OpenAI опубликовала результаты тестирования модели GPT-5.6 Sol на бенчмарке ARC-AGI-3, заявив о достижении 38,3% точности. Однако показатель был зафиксирован при использовании проприетарной среды тестирования с применением методов сжатия контекста и сохранения рассуждений. В официальных условиях тестирования без дополнительных инструментов результат модели составил лишь 7,8%, что значительно ниже показателей конкурентов.

Основная дискуссия развернулась вокруг методологии оценки способностей ИИ к абстрактному мышлению. В то время как модель Opus 5 от Anthropic продемонстрировала результат 30,2% в стандартных условиях, OpenAI настаивает на эффективности собственного подхода к тестированию. Использование кастомных инструментов позволяет модели лучше справляться с задачами, требующими длительного планирования, однако это ставит под вопрос сопоставимость данных с результатами других разработчиков.

Разрыв между результатами в «лабораторных» условиях компании и официальной среде подчеркивает сложность стандартизации оценки современных LLM. Эксперты отмечают, что использование специфических API и методов сжатия данных может искажать реальные возможности моделей при решении задач, требующих логического вывода без внешней поддержки.

Ключевые факты

  • GPT-5.6 Sol показала результат 38,3% на ARC-AGI-3 при использовании кастомной среды тестирования.
  • В официальной среде тестирования результат модели снизился до 7,8%.
  • Модель Opus 5 от Anthropic достигла 30,2% в стандартных условиях без дополнительных вспомогательных инструментов.
  • Методология OpenAI включает использование сжатия контекста и механизмов сохранения рассуждений для улучшения производительности на сложных задачах.