无梯度策略正则项

样本效率更高

一种为确定性策略梯度算法注入无梯度策略参数信息的正则化方法,通过引导策略更新避免过早收敛,提升探索能力。

申春 · Sheng, Zhu · Han, Shuai · Gong, Xiaoyu · Lü, Shuai

Expert Systems with Applications 2023

技术优势

探索更充分

GFPPI按照乐观原则促进探索,缓解策略过早收敛。

提升样本效率

在OpenAI gym实验中,GFPPI能提升样本效率并让算法获得更高性能。

应用场景