Исследователи представили WAM-Diff2 — метод иерархической дистилляции, который переносит знания из авторегрессионных Vision-Language-Action (VLA) моделей в диффузионные политики. Решение позволяет преодолеть проблему высокой задержки при последовательном декодировании, обеспечивая параллельное выполнение задач управления. Это повышает эффективность работы систем автономного вождения, сохраняя при этом точность принятия решений, характерную для крупных предобученных моделей.

Современные VLA-модели часто сталкиваются с проблемой «ошибки накопления» (exposure bias) и значительными вычислительными затратами, что критично для систем реального времени. Диффузионные модели, в свою очередь, предлагают низкую задержку за счет параллельной генерации действий, но их обучение с нуля требует огромных объемов данных и вычислительных мощностей. WAM-Diff2 решает этот конфликт, используя авторегрессионную модель как «учителя» для обучения более компактной и быстрой диффузионной «ученицы».

Метод использует иерархический подход, где дистилляция происходит на разных уровнях представления данных. Это позволяет эффективно передавать сложные паттерны поведения, необходимые для навигации в динамической городской среде, без потери качества управления. Внедрение такого подхода сокращает время инференса, что является ключевым фактором для масштабируемого развертывания систем автопилота на аппаратном обеспечении с ограниченными ресурсами.

Ключевые факты

  • WAM-Diff2 использует иерархическую дистилляцию знаний от авторегрессионных моделей к диффузионным.
  • Метод устраняет проблему последовательного декодирования, переходя к параллельному выполнению действий.
  • Решение направлено на снижение вычислительной задержки в системах автономного вождения класса VLA.
  • Подход минимизирует эффект накопления ошибок, характерный для традиционных авторегрессионных архитектур в задачах управления.