Исследователи представили новый фреймворк иерархического обучения с подкреплением (HRL), предназначенный для задач с редкими наградами и длинными временными горизонтами. Система разделяет управление на два уровня: верхний отвечает за стратегическое планирование, а нижний использует алгоритм Soft Actor-Critic (SAC) для непрерывного контроля, что позволяет эффективнее исследовать среду и достигать целей в сложных сценариях.

Основная проблема традиционных методов обучения с подкреплением в таких задачах заключается в сложности поиска оптимальной последовательности действий, когда сигнал о вознаграждении поступает крайне редко. Предложенная архитектура решает эту проблему за счет декомпозиции: высокоуровневый агент задает промежуточные подцели, которые нижний уровень выполняет с помощью энтропийно-регуляризованной политики. Такой подход значительно сокращает пространство поиска и повышает стабильность обучения в долгосрочной перспективе.

Метод демонстрирует повышенную эффективность в средах, где агент должен совершить длинную цепочку правильных действий до получения первого положительного подкрепления. Использование SAC на нижнем уровне обеспечивает плавность управления, а иерархическая структура позволяет агенту сохранять фокус на глобальной стратегии, не теряясь в хаотичном поиске случайных состояний.

Ключевые факты

  • Разработан двухуровневый иерархический фреймворк для задач с редкими наградами (sparse-reward).
  • Нижний уровень системы базируется на алгоритме Soft Actor-Critic (SAC) для непрерывного управления.
  • Архитектура использует энтропийно-регуляризованную политику для улучшения процесса исследования среды.
  • Метод направлен на решение проблем долгосрочного планирования, где агент сталкивается с задержкой получения обратной связи.