元强化学习交通信号控制器

新场景快速适应

将任务推断与控制解耦,显著提升元训练效率,使集中式交通控制在大型路网中更高效地学习。

吴佳 · Yican, Lou

IEEE/CAA Journal of Automatica Sinica 2023

参数信息

数据集数量
2

技术优势

绕开维度灾难

序列到序列模型配合注意力机制,把全局状态-动作空间拆成子空间,使模型规模不必随路口数量指数增长。

新环境学得快

上下文元强化学习把任务推断与策略控制解耦,提高元训练效率并加速新环境中的学习过程。

实测效果拔群

在两个真实世界数据集上的评估显示,该方法超过了当前最先进的深度强化学习方法和传统控制方法。

应用场景