Исследователи представили EgoGenesis — систему для синтеза высококачественных эгоцентрических видео, предназначенную для обучения embodied AI. Модель решает проблему дефицита реальных данных о манипуляциях с объектами, позволяя генерировать разнообразные сценарии действий. Использование онлайн-памяти и специализированного позиционного кодирования Action-3D RoPE обеспечивает высокую точность и управляемость видеопотока, что критически важно для тренировки робототехнических систем в виртуальной среде.

Традиционный сбор данных для обучения роботов, взаимодействующих с миром от первого лица, требует значительных временных и финансовых затрат. EgoGenesis опирается на предобученные генеративные видеомодели, дополняя их механизмами «якорной» проективной памяти. Это позволяет системе сохранять пространственную согласованность объектов при смене ракурсов и выполнении сложных манипуляций, что ранее было труднодостижимо в генеративных подходах.

Технология ориентирована на расширение обучающих выборок для агентов, работающих в физическом мире. Благодаря синтезу контролируемых видеоданных, разработчики могут создавать редкие или опасные сценарии, которые сложно зафиксировать в реальности. Это ускоряет процесс обучения моделей управления, делая их более устойчивыми к вариативности окружения и объектов, с которыми предстоит взаимодействовать роботу.

Ключевые факты

  • EgoGenesis использует метод онлайн-якорной проективной памяти для поддержания пространственной стабильности объектов в видео.
  • Архитектура включает Action-3D RoPE — специализированное позиционное кодирование для точной передачи динамики манипуляций.
  • Система предназначена для генерации синтетических данных, расширяющих возможности обучения embodied AI при дефиците реальных записей.
  • Подход позволяет создавать высококачественные видео с управляемыми действиями, сценами и типами воплощений (embodiments).