快速收敛免规则奖励
结合目标条件强化学习与自模仿机制,在没有规则奖励的情况下,让机器人臂通过视觉与力觉快速学会高精度柔性扁平电缆装配。
李婧忱 · Shi, Haobin · Hwang, Kao Shing
IEEE Transactions on Automation Science and Engineering 2023
端到端模型直接从状态映射到动作,不依赖人工设计的规则或奖励,免去繁琐的奖励工程。
通过后见之明和经验重标记,将失败探索转化为有效样本,加速策略学习,使机器人臂快速找到可行解。
该方法不依赖于特定末端执行器,只需视觉和力觉信息即可工作,适用于不同机器人平台。
在仿真环境中训练并用域适应迁移到真实场景,减少真实机器人上的训练时间和成本。