样本效率显著提升
通过轨迹效用动态重标记与保守优势学习,让机器人在稀疏奖励下更快学会复杂操作技能。
吴培良 · Zhaoqi, Wang · Li, Yao · 陈雯柏 · 高国伟
IEEE Transactions on Emerging Topics in Computational Intelligence 2025
利用轨迹效用对早期经验样本进行动态重标记,让少量样本被更充分利用,从而加速学习。
在FetchPickAndPlace任务上,相比DAS-HER,任务成功率提升46%,证明其性能优越。
通过Sim-to-Real实验验证,该方法能够有效迁移到真实机器人环境中。