Модель Claude Opus 5 от компании Anthropic продемонстрировала значительный прорыв в тестировании ARC-AGI-3, набрав 30,2%. Этот показатель почти в четыре раза превышает предыдущий рекорд в 7,8%, установленный моделью GPT-5.6 Sol. Исследователи отмечают, что модель проявила способности к самостоятельному логическому выводу, ранее не наблюдавшиеся у других систем искусственного интеллекта.
Бенчмарк ARC-AGI-3 (Abstraction and Reasoning Corpus) считается одним из наиболее сложных тестов для оценки «реального» интеллекта ИИ, так как он требует от модели способности к абстрактному мышлению и обобщению, а не простого воспроизведения заученных данных. Успех Opus 5 связывают с улучшенными механизмами логического рассуждения, которые позволяют модели решать задачи, выходящие за рамки стандартных паттернов обучения.
Особое внимание разработчиков бенчмарка привлек тот факт, что Claude Opus 5 самостоятельно сформулировала уравнения для рефлексии в процессе поиска решения. Подобное поведение свидетельствует о способности модели к адаптивному планированию и самокоррекции, что является важным шагом в развитии систем, приближающихся к уровню человеческого понимания сложных логических конструкций.
Ключевые факты
- Claude Opus 5 достигла результата 30,2% в тесте ARC-AGI-3.
- Предыдущий рекорд, установленный GPT-5.6 Sol, составлял 7,8%.
- Модель продемонстрировала способность к самостоятельному выводу уравнений рефлексии.
- Тест ARC-AGI-3 сфокусирован на оценке абстрактного мышления и логики, а не на объеме накопленных знаний.
