Исследователи представили IGGT4D — архитектуру на базе трансформеров для потоковой реконструкции 4D-геометрии объектов. Модель эффективно обрабатывает динамические сцены, объединяя пространственную геометрию и временную динамику. Метод демонстрирует высокую точность в задачах инстансной сегментации и восстановления формы движущихся объектов, что открывает новые возможности для компьютерного зрения, автономных систем и технологий дополненной реальности.

В основе решения лежит использование инстансно-ориентированных представлений, которые позволяют модели фокусироваться на отдельных объектах внутри сцены, а не на статичном фоне. Это критически важно для обработки видеопотоков, где объекты постоянно меняют положение, форму и степень перекрытия другими элементами. Использование трансформеров позволяет эффективно моделировать долгосрочные зависимости между кадрами, обеспечивая стабильность геометрии во времени.

Технология решает проблему «дрожания» и потери консистентности, характерную для традиционных методов реконструкции, работающих покадрово. Благодаря оптимизации архитектуры, система способна обрабатывать данные с высокой частотой, что приближает её к использованию в интерактивных приложениях, требующих мгновенного отклика и точного понимания физического пространства.

Ключевые факты

  • IGGT4D использует механизм Instance-Grounded для разделения объектов и фона в динамических сценах.
  • Архитектура основана на трансформерах, оптимизированных для работы с 4D-данными (3D-пространство плюс время).
  • Метод обеспечивает высокую временную консистентность при реконструкции формы движущихся объектов.
  • Решение ориентировано на задачи компьютерного зрения, требующие обработки видеопотока в реальном времени.