Исследователи представили архитектуру Master-Agent Proto-plan System (MAPS) для решения проблемы координации беспилотных автомобилей на нерегулируемых перекрестках. Система использует иерархическое глубокое обучение с подкреплением, позволяя агентам эффективно взаимодействовать без опоры на привилегированную информацию или жесткие сценарии, что значительно повышает безопасность и пропускную способность в сложных дорожных условиях.
Традиционные методы обучения с подкреплением для нескольких агентов (MARL) часто сталкиваются с проблемой комбинаторного взрыва пространства действий, что затрудняет масштабирование системы. MAPS разделяет процесс принятия решений на уровни: мастер-агент формирует высокоуровневый план действий, который затем декомпозируется на конкретные маневры для каждого транспортного средства. Это позволяет системе адаптироваться к динамически меняющейся обстановке без необходимости предварительного обучения для каждой возможной комбинации автомобилей.
Данный подход демонстрирует преимущества в сценариях, где требуется высокая степень согласованности действий между независимыми участниками движения. В отличие от централизованных систем, MAPS сохраняет гибкость, позволяя агентам учитывать локальные условия, сохраняя при этом общую стратегию проезда перекрестка. Исследование подтверждает эффективность метода в снижении количества конфликтных ситуаций и оптимизации времени ожидания при отсутствии светофорного регулирования.
Ключевые факты
- Архитектура MAPS основана на иерархическом глубоком обучении с подкреплением (DRL).
- Система устраняет зависимость от «привилегированной информации», которую часто используют другие MARL-модели.
- Метод направлен на решение проблемы комбинаторного пространства действий при взаимодействии нескольких автономных агентов.
- Разработка сфокусирована на повышении эффективности движения на нерегулируемых перекрестках, где отсутствует централизованное управление потоком.