Исследователи представили архитектуру Master-Agent Proto-plan System (MAPS) для решения проблемы координации беспилотных автомобилей на нерегулируемых перекрестках. Система использует иерархическое глубокое обучение с подкреплением, позволяя агентам эффективно взаимодействовать без опоры на привилегированную информацию или жесткие сценарии, что значительно повышает безопасность и пропускную способность в сложных дорожных условиях.

Традиционные методы обучения с подкреплением для нескольких агентов (MARL) часто сталкиваются с проблемой комбинаторного взрыва пространства действий, что затрудняет масштабирование системы. MAPS разделяет процесс принятия решений на уровни: мастер-агент формирует высокоуровневый план действий, который затем декомпозируется на конкретные маневры для каждого транспортного средства. Это позволяет системе адаптироваться к динамически меняющейся обстановке без необходимости предварительного обучения для каждой возможной комбинации автомобилей.

Данный подход демонстрирует преимущества в сценариях, где требуется высокая степень согласованности действий между независимыми участниками движения. В отличие от централизованных систем, MAPS сохраняет гибкость, позволяя агентам учитывать локальные условия, сохраняя при этом общую стратегию проезда перекрестка. Исследование подтверждает эффективность метода в снижении количества конфликтных ситуаций и оптимизации времени ожидания при отсутствии светофорного регулирования.

Ключевые факты

  • Архитектура MAPS основана на иерархическом глубоком обучении с подкреплением (DRL).
  • Система устраняет зависимость от «привилегированной информации», которую часто используют другие MARL-модели.
  • Метод направлен на решение проблемы комбинаторного пространства действий при взаимодействии нескольких автономных агентов.
  • Разработка сфокусирована на повышении эффективности движения на нерегулируемых перекрестках, где отсутствует централизованное управление потоком.