乒乓球分层控制策略

对打52回合

一种分层强化学习策略,通过渐进式自对弈和衰减奖励机制增强击球稳健性,在对抗其他策略时取得优势。

马宏绪 · Fan, Jianyin · Haoran, Xu · 王强

Applied Intelligence 2025

参数信息

正手对打回合数
52 次
反手对打回合数
48 次

技术优势

分层利用数据

通过分层结构,模型无需从零学习复杂策略,而是将任务分解为高层决策与低层控制,从而更高效地利用交互数据。

自对弈增强稳健

通过预训练、自对弈和顶级获胜策略的自对弈,低层击球策略的稳健性得到增强,使策略在对抗中表现更稳定。

衰减奖励提胜率

在高层智能体训练中采用新颖的衰减奖励机制,提高了与其他方法对抗时的胜率。

应用场景