前推分布式强化学习算法

探索更广策略空间

首个完全基于前推算子的分布式强化学习算法,通过分布评论家、随机演员和基于样本的激励器,充分利用前推建模能力探索更广泛的策略空间。

Wensong, Bai · 张超 · Yichao, Fu · Zhao, Peilin · 钱徽

Neurocomputing 2025

参数信息

平均得分提升
10 %

技术优势

策略空间更广

通过前推算子表达随机策略,摆脱高斯等参数化分布的限制,能够表示更复杂的策略分布。

不需要密度函数

提出基于样本的随机效用值策略梯度,避免对前推策略密度函数的显式要求,使训练可行。

探索更高效

引入基于样本的正则化项激励探索,降低陷入局部最优的风险。

应用场景