近端对抗强化学习算法

模型失配下仍鲁棒

该算法将对抗优化目标从长期累积奖励变为短期奖励,并通过投影梯度下降限制对抗强度,使策略在仿真与真实环境模型失配时仍具备优越的泛化能力。

翟鹏 · Xiaoyi, Wei · Taixian, Hou · 姬晓鹏 · Dong, Zhiyan · Yi, Jiafu · 张利华

IEEE Robotics and Automation Letters 2024

技术优势

策略更鲁棒

通过投影梯度下降将对抗动作约束在有限扰动子集中,有效限制对手强度,使策略在模型失配下仍保持高性能。

对抗训练更聚焦

将对手的优化目标从长期累积奖励改为短期奖励,使对抗训练更关注近期性能,提高训练效率。

部署轻量化

算法轻量且高效,便于在实际机器人平台上部署,无需复杂改造。

应用场景