模型梯度强化学习算法

样本效率高

通过统一模型与策略的学习目标,在提升样本效率的同时实现更优的收敛性能。

Chengxing, Jia · Fuxiang, Zhang · 许天 · Jing-Cheng, Pang · 章宗长 · Yang, Yu

Frontiers of Computer Science 2024

技术优势

目标一致

模型学习与策略学习共享最大化真实环境期望回报的目标,模型学习为策略梯度提供更有利的更新方向。

收敛更好

相比传统基于模型的强化学习方法,MG 在多个运动控制任务上取得更优的收敛性能。

样本效率高

由于模型学习直接服务于策略优化,MG 能用更少的环境交互学习到有效策略。

应用场景