显著降低延误
一种单智能体深度强化学习交通信号控制方法,首次在动作空间中考虑行人过街干扰,并设计了动态权重的软演员-评论家算法,相比传统方法收敛更快、性能更优。
Qiao, Zhimin · 柯良军
Kongzhi Lilun Yu Yinyong/Control Theory and Applications 2025
首次在动作空间中纳入行人过街干扰,使信号控制更贴近实际路口环境,从而减少人车冲突。
通过动态调整演员网络和评论家网络的更新幅度,显著提升了传统软演员-评论家算法的收敛效率。
定义了三种从不同角度出发的奖励函数,并提出了累积延误近似方法,使学习目标更全面。