三重网络算法

收敛更快更稳

用三个同步训练的网络分别估计状态价值、动作价值和策略,在离散场景下收敛速度和稳定性优于PPO,且不增加计算量。

Han, Chen · 王宣银

Neurocomputing 2024

技术优势

收敛更快

三网络同步训练、互相影响,避免目标网络缓慢更新拖慢学习速度,离散场景下收敛速度优于PPO。

额外计算为零

虽然使用了三个网络,但架构设计避免了计算量增加,与现有算法计算成本相当。

易于实现

计算流程简单,不依赖复杂的目标网络更新机制,便于集成到现有强化学习环境。

应用场景