Представлена WorldDiT — диффузионная модель с 399 млн параметров, предназначенная для предсказания динамики среды и выполнения задач в робототехнических симуляциях. Модель обучалась на наборах данных с взаимодействиями роботов, позволяя генерировать последовательности состояний и действий, что критически важно для обучения агентов в условиях ограниченных вычислительных ресурсов и необходимости быстрого планирования движений.

Архитектура модели базируется на принципах диффузионных трансформеров (DiT), которые показывают высокую эффективность в генерации сложных временных рядов. В отличие от крупномасштабных видеомоделей, WorldDiT сфокусирована на физически корректном моделировании «мира» робота, что упрощает перенос навыков из виртуальной среды в реальные физические системы. Это решение снижает порог входа для исследователей, работающих над автономными манипуляторами.

Использование диффузионного подхода позволяет модели лучше справляться с неопределенностью в действиях робота, предлагая вероятностные траектории вместо жестких сценариев. Разработчики предоставили доступ к весам модели на платформе Hugging Face, что способствует дальнейшей интеграции в пайплайны обучения с подкреплением и агентные системы управления движением.

Ключевые факты

  • Размер модели составляет 399 миллионов параметров, что делает её пригодной для запуска на относительно доступном оборудовании.
  • Модель специализируется на предсказании состояний мира и действий робота в рамках симулированных задач.
  • В основе лежит архитектура диффузионных трансформеров (DiT), оптимизированная для задач робототехники.
  • Веса модели и документация доступны для открытого использования на Hugging Face.