新场景快速适应
将任务推断与控制解耦,显著提升元训练效率,使集中式交通控制在大型路网中更高效地学习。
吴佳 · Yican, Lou
IEEE/CAA Journal of Automatica Sinica 2023
序列到序列模型配合注意力机制,把全局状态-动作空间拆成子空间,使模型规模不必随路口数量指数增长。
上下文元强化学习把任务推断与策略控制解耦,提高元训练效率并加速新环境中的学习过程。
在两个真实世界数据集上的评估显示,该方法超过了当前最先进的深度强化学习方法和传统控制方法。