MCLDPPO算法

空战决策超越人类

一种用于空战游戏的深度强化学习新算法,结合动机课程学习与中断机制,智能体性能显著超越预测博弈树和主流强化学习方法。

Jingyu, Zhu · 匡敏驰 · Zhou, Wenqing · 史恒 · 朱纪洪 · Xu, Han

Defence Technology 2023

技术优势

摆脱可塑性损失

动机课程学习通过观察智能体表现不佳的环节提供适当奖励,逐步引导其提升作战能力,避免了传统课程学习导致的可塑性损失问题。

超人类战术

将完整战术机动封装为可灵活调用的模块,智能体可以组合这些机动实现超越人类知识的战术。

紧急响应更及时

当智能体受到的威胁数量变化时,中断机制会打断当前动作,立即重新获取观测并决策,从而提升紧急情况下的反应能力。

训练吞吐倍增

并行战场机制可同时运行多个仿真环境,有效提高数据吞吐量,加速训练。

应用场景