Исследователи представили фреймворк для настройки функций вознаграждения в обучении с подкреплением без модели (model-free RL), решающий проблему «паралича политики» и избыточной осторожности агентов. На примере задачи автоматической парковки автомобилей с нехолономными ограничениями метод демонстрирует, как параметризованное формирование вознаграждения и регуляризация переключения направлений движения позволяют агентам избегать локальных минимумов и эффективно достигать целевых состояний.

Традиционные подходы к проектированию функций вознаграждения часто приводят к тому, что ИИ-агенты застревают в неоптимальных стратегиях, опасаясь совершить любое действие из-за жестких штрафов. Предложенный подход использует механизм «coverage-gated alignment feedback», который динамически адаптирует сигналы обратной связи в зависимости от покрытия пространства состояний. Это позволяет системе лучше балансировать между скоростью обучения и безопасностью маневров.

Практическая значимость работы заключается в возможности применения алгоритма для сложных робототехнических систем, где критически важна точность управления при наличии физических ограничений. Регуляризация переключения направлений движения помогает агенту плавно переходить между режимами парковки, минимизируя резкие и неэффективные движения, которые характерны для стандартных методов обучения с подкреплением в подобных средах.

Ключевые факты

  • Разработан параметризованный фреймворк для формирования функций вознаграждения в условиях нехолономных ограничений.
  • Метод успешно протестирован на задаче автономной парковки, демонстрируя преодоление проблемы «паралича политики».
  • Внедрена система регуляризации переключения направлений движения для повышения плавности и эффективности маневров.
  • Использован механизм coverage-gated alignment feedback для улучшения стабильности обучения в сложных пространствах состояний.