Исследователи представили новый фреймворк иерархического обучения с подкреплением (HRL), предназначенный для задач с редкими наградами и длинными временными горизонтами. Система разделяет управление на два уровня: верхний отвечает за стратегическое планирование, а нижний использует алгоритм Soft Actor-Critic (SAC) для непрерывного контроля, что позволяет эффективнее исследовать среду и достигать целей в сложных сценариях.
Основная проблема традиционных методов обучения с подкреплением в таких задачах заключается в сложности поиска оптимальной последовательности действий, когда сигнал о вознаграждении поступает крайне редко. Предложенная архитектура решает эту проблему за счет декомпозиции: высокоуровневый агент задает промежуточные подцели, которые нижний уровень выполняет с помощью энтропийно-регуляризованной политики. Такой подход значительно сокращает пространство поиска и повышает стабильность обучения в долгосрочной перспективе.
Метод демонстрирует повышенную эффективность в средах, где агент должен совершить длинную цепочку правильных действий до получения первого положительного подкрепления. Использование SAC на нижнем уровне обеспечивает плавность управления, а иерархическая структура позволяет агенту сохранять фокус на глобальной стратегии, не теряясь в хаотичном поиске случайных состояний.
Ключевые факты
- Разработан двухуровневый иерархический фреймворк для задач с редкими наградами (sparse-reward).
- Нижний уровень системы базируется на алгоритме Soft Actor-Critic (SAC) для непрерывного управления.
- Архитектура использует энтропийно-регуляризованную политику для улучшения процесса исследования среды.
- Метод направлен на решение проблем долгосрочного планирования, где агент сталкивается с задержкой получения обратной связи.