Представлена WorldDiT — диффузионная модель с 399 млн параметров, предназначенная для предсказания динамики среды и выполнения задач в робототехнических симуляциях. Модель обучалась на наборах данных с взаимодействиями роботов, позволяя генерировать последовательности состояний и действий, что критически важно для обучения агентов в условиях ограниченных вычислительных ресурсов и необходимости быстрого планирования движений.
Архитектура модели базируется на принципах диффузионных трансформеров (DiT), которые показывают высокую эффективность в генерации сложных временных рядов. В отличие от крупномасштабных видеомоделей, WorldDiT сфокусирована на физически корректном моделировании «мира» робота, что упрощает перенос навыков из виртуальной среды в реальные физические системы. Это решение снижает порог входа для исследователей, работающих над автономными манипуляторами.
Использование диффузионного подхода позволяет модели лучше справляться с неопределенностью в действиях робота, предлагая вероятностные траектории вместо жестких сценариев. Разработчики предоставили доступ к весам модели на платформе Hugging Face, что способствует дальнейшей интеграции в пайплайны обучения с подкреплением и агентные системы управления движением.
Ключевые факты
- Размер модели составляет 399 миллионов параметров, что делает её пригодной для запуска на относительно доступном оборудовании.
- Модель специализируется на предсказании состояний мира и действий робота в рамках симулированных задач.
- В основе лежит архитектура диффузионных трансформеров (DiT), оптимизированная для задач робототехники.
- Веса модели и документация доступны для открытого использования на Hugging Face.