Исследователи представили метод DLAM (Distributional Latent Actions), позволяющий эффективно обучать Vision-Language-Action модели, используя видео без разметки действий. В условиях дефицита данных для робототехники подход позволяет извлекать полезные закономерности из обширных массивов видеоданных, обеспечивая при этом необходимую временную согласованность и структуру для генерации управляющих команд роботам в связке с текстовыми инструкциями.
Основная проблема существующих VLA-моделей заключается в зависимости от дорогостоящих наборов данных, где каждое действие робота размечено вручную. DLAM решает эту задачу через использование латентных пространств действий, которые обучаются предсказывать физические изменения в кадре. В отличие от стандартных методов реконструкции, которые часто игнорируют структуру последовательных движений, данный подход накладывает временные ограничения на латентные коды.
Это позволяет модели лучше понимать динамику физического мира, даже если в обучающей выборке отсутствуют явные метки действий. В результате система способна эффективнее переносить знания из неразмеченных видео в задачи управления робототехническими манипуляторами, что значительно расширяет возможности обучения агентов в реальных физических средах.
Ключевые факты
- Метод DLAM использует распределенные латентные действия для обучения моделей на видео без разметки.
- Подход преодолевает проблему нехватки данных с разметкой действий, характерную для современной робототехники.
- Временные ограничения в модели обеспечивают структурную целостность при генерации последовательностей действий.
- Метод позволяет эффективно объединять визуальные наблюдения с текстовыми инструкциями для управления роботами.