Исследователи представили World Critic Model (WCM) — метод обучения VLA-моделей (Vision-Language-Action), решающий проблему неполной наблюдаемости в робототехнике. В отличие от традиционных подходов, использующих оценку отдельных кадров, WCM интегрирует временную динамику в процесс обучения критика. Это позволяет агентам лучше учитывать контекст последовательностей при выполнении манипуляционных задач, повышая точность управления в сложных условиях.

Традиционные методы обучения с подкреплением для VLA-моделей часто опираются на оценку состояния по одному кадру, что создает фундаментальное несоответствие с реальными задачами робототехники, где состояние среды скрыто или частично наблюдаемо. WCM вводит механизм «мирового критика», который анализирует временные зависимости в данных, позволяя модели предсказывать ценность действий на основе истории наблюдений, а не только текущего снимка камеры.

Архитектура WCM эффективно использует скрытые представления из предобученных VLM-бэкбонов, адаптируя их для задач управления. Метод демонстрирует значительное преимущество в задачах, требующих долгосрочного планирования и понимания физических взаимодействий, где статичные оценки часто приводят к ошибкам в траектории движения манипулятора.

Ключевые факты

  • Метод WCM (World Critic Model) предназначен для обучения VLA-моделей в задачах робототехнической манипуляции.
  • Основная инновация заключается в переходе от покадровой оценки ценности действий к анализу временных последовательностей.
  • Решение устраняет проблему частичной наблюдаемости (POMDP), характерную для управления роботами в динамических средах.
  • Подход оптимизирует использование латентных представлений из Vision-Language-моделей для повышения качества обучения с подкреплением.