Исследователи предложили метод улучшения планирования в world models, который решает проблему накопления ошибок при выборе действий. Вместо слепого следования последовательности с минимальной предсказанной стоимостью, алгоритм учитывает действия из «смежного множества» в физическом пространстве. Это позволяет избежать выбора невыполнимых траекторий, которые ошибочно кажутся оптимальными из-за остаточных ошибок прогнозирования модели.
Традиционные контроллеры, основанные на латентных моделях мира, часто полагаются на минимизацию терминальной стоимости. Однако даже при высокой точности предсказаний, модель может присвоить аномально низкую стоимость нереализуемым последовательностям действий. Новый подход корректирует этот процесс, анализируя соседние действия в физическом пространстве, что делает управление более устойчивым к погрешностям латентного представления.
Метод демонстрирует, что для успешного выполнения задач в физическом мире недостаточно просто минимизировать функцию потерь внутри модели. Необходимо учитывать ограничения пространства действий и физическую реализуемость траекторий, что критически важно для развития автономных робототехнических систем и сложных агентных сред.
Ключевые факты
- Метод направлен на устранение ошибок при планировании, вызванных неверной оценкой стоимости в латентных пространствах.
- Использование «смежного множества» действий позволяет отсеивать невыполнимые последовательности, которые модель ошибочно помечает как оптимальные.
- Исследование решает проблему расхождения между предсказанной стоимостью в модели и реальным физическим результатом выполнения задачи.
- Предложенный подход повышает надежность контроллеров, работающих на основе итеративного планирования и перепланирования (replanning).