模型失配下仍鲁棒
该算法将对抗优化目标从长期累积奖励变为短期奖励,并通过投影梯度下降限制对抗强度,使策略在仿真与真实环境模型失配时仍具备优越的泛化能力。
翟鹏 · Xiaoyi, Wei · Taixian, Hou · 姬晓鹏 · Dong, Zhiyan · Yi, Jiafu · 张利华
IEEE Robotics and Automation Letters 2024
通过投影梯度下降将对抗动作约束在有限扰动子集中,有效限制对手强度,使策略在模型失配下仍保持高性能。
将对手的优化目标从长期累积奖励改为短期奖励,使对抗训练更关注近期性能,提高训练效率。
算法轻量且高效,便于在实际机器人平台上部署,无需复杂改造。