OpenAI опубликовала результаты исследования, согласно которым изменение двух параметров API позволило модели GPT-5.6 утроить показатели в бенчмарке ARC-AGI-3. Настройка параметров, отвечающих за сохранение цепочки рассуждений и механизмы сжатия контекста, позволила модели эффективнее справляться с задачами на абстрактное мышление, демонстрируя значительный рост производительности без необходимости дообучения самой архитектуры нейросети.

Бенчмарк ARC-AGI-3 считается одним из наиболее сложных тестов для оценки способности моделей к обобщению и решению задач, с которыми они ранее не сталкивались. Традиционные подходы к повышению метрик часто фокусируются на увеличении количества параметров или расширении обучающей выборки. В данном случае инженеры сфокусировались на оптимизации процесса инференса, что позволило модели лучше удерживать логическую структуру при выполнении многошаговых задач.

Ключевым фактором успеха стало внедрение методов, которые предотвращают потерю контекста при обработке длинных последовательностей. Использование специфических настроек сжатия позволило модели сохранять критически важные промежуточные выводы, что критически важно для тестов, требующих построения сложных логических цепочек. Это подтверждает гипотезу о том, что текущие возможности моделей часто ограничиваются не только их весами, но и способами взаимодействия с контекстным окном.

Ключевые факты

  • Использование двух новых настроек API привело к трехкратному росту баллов в бенчмарке ARC-AGI-3.
  • Исследование проводилось на модели GPT-5.6, ориентированной на задачи повышенной сложности.
  • Оптимизация позволила улучшить показатели за счет более эффективного сохранения цепочки рассуждений (reasoning).
  • Внедрение механизмов сжатия данных (compaction) помогло модели лучше справляться с обработкой длинных логических цепочек в рамках теста.