Исследователи представили архитектуру TraceViT, направленную на улучшение способности ИИ-моделей к абстрактному мышлению в задачах ARC (Abstraction and Reasoning Corpus). В отличие от стандартных подходов, где оценивается только финальный результат, метод вводит «трассировочный надзор» (grounded trace supervision). Это заставляет модель выстраивать логически обоснованную последовательность промежуточных шагов при решении визуальных задач, что значительно повышает точность обобщения правил трансформации.

Традиционные визуальные модели часто сталкиваются с трудностями при попытке перенести логику из нескольких примеров на новую задачу. Авторы TraceViT утверждают, что проблема кроется в отсутствии контроля за процессом рассуждения. Обучение на промежуточных состояниях (трассах) позволяет модели лучше понимать структуру изменений в сетках данных, что делает процесс принятия решений более прозрачным и устойчивым к сложным визуальным паттернам.

Данный подход опирается на архитектуру Vision Transformer (ViT) и адаптирует её для итеративного уточнения прогнозов. Вместо того чтобы просто выдавать итоговую сетку, модель обучается генерировать цепочку преобразований, которая ведет к правильному ответу. Это приближает работу нейросетей к человеческому способу решения задач, где каждый шаг логически вытекает из предыдущего, а не является результатом «черного ящика».

Ключевые факты

  • TraceViT использует метод grounded trace supervision для контроля промежуточных итераций визуального мышления.
  • Основным полигоном для тестирования модели стал бенчмарк ARC, требующий вывода правил трансформации из минимального количества примеров.
  • Метод решает проблему «неограниченных промежуточных состояний», характерную для классических итеративных визуальных моделей.
  • Архитектура базируется на принципах Vision Transformer, оптимизированных для последовательного уточнения визуальных данных.