Исследователи представили фреймворк SAM3D-Guided, направленный на устранение дефицита пространственного понимания у Vision-Language-Action (VLA) моделей. В отличие от стандартных решений, опирающихся на 2D-бэкенды, новый подход интегрирует объектно-ориентированные 3D-представления. Это позволяет роботам точнее взаимодействовать с объектами в условиях окклюзии, изменения масштаба и вариативности поз, значительно повышая качество манипуляций в сложных визуальных сценах.
Современные VLA-модели часто сталкиваются с трудностями при интерпретации трехмерного пространства, так как их архитектуры преимущественно заточены под обработку плоских изображений. Метод SAM3D-Guided использует специализированное выравнивание представлений, которое связывает визуальные данные с 3D-геометрией объектов. Это позволяет системе сохранять стабильность восприятия даже при частичном перекрытии целевых предметов или изменении ракурса камеры.
Внедрение объектно-центричного подхода решает проблему «размытого» восприятия, характерную для моделей, обучаемых на общих наборах данных. Благодаря интеграции с архитектурой π₀, фреймворк обеспечивает более точное сопоставление семантических команд с физическими координатами в пространстве. Это критически важно для задач, требующих высокой точности захвата и перемещения предметов в неструктурированной среде, где классические 2D-подходы показывают низкую надежность.
Ключевые факты
- Фреймворк использует объектно-ориентированное 3D-выравнивание для улучшения работы VLA-моделей.
- Решение базируется на архитектуре π₀, адаптируя её для задач манипуляции роботами.
- Метод эффективно нивелирует ошибки, вызванные окклюзией, изменением масштаба и вариативностью поз объектов.
- Подход преодолевает ограничения традиционных 2D-визуальных бэкендов в задачах пространственного взаимодействия.