样本效率更高
一种为确定性策略梯度算法注入无梯度策略参数信息的正则化方法,通过引导策略更新避免过早收敛,提升探索能力。
申春 · Sheng, Zhu · Han, Shuai · Gong, Xiaoyu · Lü, Shuai
Expert Systems with Applications 2023
GFPPI按照乐观原则促进探索,缓解策略过早收敛。
在OpenAI gym实验中,GFPPI能提升样本效率并让算法获得更高性能。