探索更广策略空间
首个完全基于前推算子的分布式强化学习算法,通过分布评论家、随机演员和基于样本的激励器,充分利用前推建模能力探索更广泛的策略空间。
Wensong, Bai · 张超 · Yichao, Fu · Zhao, Peilin · 钱徽
Neurocomputing 2025
通过前推算子表达随机策略,摆脱高斯等参数化分布的限制,能够表示更复杂的策略分布。
提出基于样本的随机效用值策略梯度,避免对前推策略密度函数的显式要求,使训练可行。
引入基于样本的正则化项激励探索,降低陷入局部最优的风险。