Исследователи представили ARC-AGI-3 — обновленный бенчмарк для оценки способности ИИ-систем к абстрактному мышлению и решению задач, выходящих за рамки простого запоминания данных. Новый набор тестов фокусируется на агентных возможностях моделей, требуя от них демонстрации навыков планирования, адаптации к неизвестным условиям и эффективного использования инструментов для достижения сложных целей в динамической среде.
В отличие от предыдущих версий, ARC-AGI-3 делает упор на проверку «обобщающего интеллекта», который критически важен для автономных агентов. Разработчики стремятся выявить разрыв между текущими LLM, которые полагаются на статистические закономерности из обучающей выборки, и системами, способными к логическому выводу в ситуациях, с которыми они ранее не сталкивались. Это позволяет более точно измерить прогресс на пути к созданию универсального ИИ.
Бенчмарк включает в себя задачи, требующие многошагового взаимодействия с окружением, где успех зависит не только от точности генерации текста, но и от способности модели корректировать стратегию при получении обратной связи. Такой подход помогает отсеять модели, демонстрирующие лишь поверхностную имитацию интеллекта, и выделить архитектуры, обладающие реальными способностями к решению проблем.
Ключевые факты
- ARC-AGI-3 ориентирован на проверку агентных способностей, а не только на текстовую генерацию.
- Тестовые задания требуют от моделей планирования и адаптивного использования инструментов.
- Основная цель бенчмарка — измерение способности ИИ к абстрактному мышлению в новых, незнакомых условиях.
- Методология направлена на выявление разрыва между статистическим обучением и логическим выводом.