乒乓球分层控制策略
对打52回合
一种分层强化学习策略,通过渐进式自对弈和衰减奖励机制增强击球稳健性,在对抗其他策略时取得优势。
马宏绪 · Fan, Jianyin · Haoran, Xu · 王强
Applied Intelligence 2025
参数信息
- 正手对打回合数
- 52 次
- 反手对打回合数
- 48 次
技术优势
分层利用数据
通过分层结构,模型无需从零学习复杂策略,而是将任务分解为高层决策与低层控制,从而更高效地利用交互数据。
自对弈增强稳健
通过预训练、自对弈和顶级获胜策略的自对弈,低层击球策略的稳健性得到增强,使策略在对抗中表现更稳定。
衰减奖励提胜率
在高层智能体训练中采用新颖的衰减奖励机制,提高了与其他方法对抗时的胜率。
应用场景
- 机器人运动控制:为机械臂提供高连续性的对打控制策略,可直接用于乒乓球机器人底层动作执行。
- 具身智能决策:展示分层决策在真实机器人高速交互任务中的可行性,为具身智能决策提供范式。
- 强化学习应用:无需精确环境模型,仅用无模型策略层即可训练出稳定对打策略,降低强化学习落地门槛。
- 人形机器人技能:验证了人形机器人执行快速动态任务的技能学习方法,可迁移至其他需要精确时序控制的技能。