收敛更快更稳
用三个同步训练的网络分别估计状态价值、动作价值和策略,在离散场景下收敛速度和稳定性优于PPO,且不增加计算量。
Han, Chen · 王宣银
Neurocomputing 2024
三网络同步训练、互相影响,避免目标网络缓慢更新拖慢学习速度,离散场景下收敛速度优于PPO。
虽然使用了三个网络,但架构设计避免了计算量增加,与现有算法计算成本相当。
计算流程简单,不依赖复杂的目标网络更新机制,便于集成到现有强化学习环境。