Исследователи представили метод DLAM (Distributional Latent Actions), позволяющий эффективно обучать Vision-Language-Action модели, используя видео без разметки действий. В условиях дефицита данных для робототехники подход позволяет извлекать полезные закономерности из обширных массивов видеоданных, обеспечивая при этом необходимую временную согласованность и структуру для генерации управляющих команд роботам в связке с текстовыми инструкциями.

Основная проблема существующих VLA-моделей заключается в зависимости от дорогостоящих наборов данных, где каждое действие робота размечено вручную. DLAM решает эту задачу через использование латентных пространств действий, которые обучаются предсказывать физические изменения в кадре. В отличие от стандартных методов реконструкции, которые часто игнорируют структуру последовательных движений, данный подход накладывает временные ограничения на латентные коды.

Это позволяет модели лучше понимать динамику физического мира, даже если в обучающей выборке отсутствуют явные метки действий. В результате система способна эффективнее переносить знания из неразмеченных видео в задачи управления робототехническими манипуляторами, что значительно расширяет возможности обучения агентов в реальных физических средах.

Ключевые факты

  • Метод DLAM использует распределенные латентные действия для обучения моделей на видео без разметки.
  • Подход преодолевает проблему нехватки данных с разметкой действий, характерную для современной робототехники.
  • Временные ограничения в модели обеспечивают структурную целостность при генерации последовательностей действий.
  • Метод позволяет эффективно объединять визуальные наблюдения с текстовыми инструкциями для управления роботами.