Исследователи NVIDIA представили концепцию World Action Models (WAM), которая меняет подход к обучению роботов взаимодействию с физическими объектами. В отличие от традиционных Vision-Language-Action (VLA) моделей, WAM обучаются предсказывать последствия действий в динамической среде. Это позволяет роботам лучше обобщать навыки и выполнять сложные манипуляции в условиях, выходящих за рамки обучающих демонстраций, повышая автономность систем в непредсказуемых сценариях.

Основная проблема классических VLA-моделей заключается в их зависимости от ограниченных наборов данных. Роботы часто теряются, если сцена или объект немного отличаются от тех, что были в обучающей выборке. Модели WAM решают эту задачу, интегрируя понимание физики мира: они не просто копируют движения, а моделируют вероятные изменения состояния среды после каждого действия. Такой подход приближает робототехнику к созданию универсальных агентов, способных адаптироваться к новым задачам «на лету».

Внедрение WAM позволяет сократить количество необходимых демонстраций для обучения, так как модель учится на основе предсказательных моделей мира, а не только на прямой имитации поведения. Это значительно снижает затраты на сбор данных и ускоряет развертывание робототехнических решений в логистике и промышленной автоматизации, где вариативность объектов и условий является критическим фактором.

Ключевые факты

  • World Action Models (WAM) фокусируются на предсказании динамики среды, а не только на сопоставлении визуальных данных с командами.
  • Новый подход позволяет роботам эффективнее обобщать навыки, выполняя задачи в сценах, которые не были представлены в обучающей выборке.
  • Использование WAM снижает зависимость от огромных массивов размеченных данных, необходимых для обучения традиционных VLA-моделей.
  • Технология направлена на решение проблемы «хрупкости» робототехнических политик при изменении освещения, расположения предметов или их геометрии.