深度强化学习交通信号控制器

显著降低延误

一种单智能体深度强化学习交通信号控制方法,首次在动作空间中考虑行人过街干扰,并设计了动态权重的软演员-评论家算法,相比传统方法收敛更快、性能更优。

Qiao, Zhimin · 柯良军

Kongzhi Lilun Yu Yinyong/Control Theory and Applications 2025

技术优势

考虑行人干扰

首次在动作空间中纳入行人过街干扰,使信号控制更贴近实际路口环境,从而减少人车冲突。

收敛更快

通过动态调整演员网络和评论家网络的更新幅度,显著提升了传统软演员-评论家算法的收敛效率。

奖励设计全面

定义了三种从不同角度出发的奖励函数,并提出了累积延误近似方法,使学习目标更全面。

应用场景