Исследователи представили метод Wasserstein Policy Gradient (WPG), оптимизирующий стратегии управления через транспорт в пространстве действий. В контексте линейно-квадратичного контроля с энтропийной регуляризацией авторы доказали, что градиент, взвешенный по дисконтированной занятости состояний, остается касательным к классу линейно-гауссовских стратегий. Это позволяет эффективно находить оптимальные решения в задачах управления с непрерывным пространством действий.
Традиционные методы градиента стратегии часто сталкиваются с трудностями при работе с распределениями действий в непрерывных пространствах. Использование Вассерштейнова расстояния позволяет переформулировать процесс обновления стратегии как задачу оптимального транспорта. Это обеспечивает более стабильную сходимость и теоретическую обоснованность при поиске оптимальных параметров управления в динамических системах.
Математический анализ, проведенный с помощью верификационного аргумента Беллмана, подтверждает, что предложенный подход сохраняет структуру оптимальной линейно-гауссовской политики. Данная работа расширяет инструментарий обучения с подкреплением, предлагая более строгий математический аппарат для задач, где требуется баланс между исследованием среды и использованием накопленных знаний через энтропийную регуляризацию.
Ключевые факты
- Метод WPG использует транспорт в пространстве действий для обновления условных законов распределения.
- Исследование сфокусировано на линейно-квадратичном (LQ) контроле с дисконтированием и энтропийной регуляризацией.
- Доказано, что градиент Вассерштейна, взвешенный по занятости состояний, сохраняет принадлежность к классу линейно-гауссовских стратегий.
- Подход опирается на верификационный аргумент Беллмана для подтверждения оптимальности стратегии.