空战决策超越人类
一种用于空战游戏的深度强化学习新算法,结合动机课程学习与中断机制,智能体性能显著超越预测博弈树和主流强化学习方法。
Jingyu, Zhu · 匡敏驰 · Zhou, Wenqing · 史恒 · 朱纪洪 · Xu, Han
Defence Technology 2023
动机课程学习通过观察智能体表现不佳的环节提供适当奖励,逐步引导其提升作战能力,避免了传统课程学习导致的可塑性损失问题。
将完整战术机动封装为可灵活调用的模块,智能体可以组合这些机动实现超越人类知识的战术。
当智能体受到的威胁数量变化时,中断机制会打断当前动作,立即重新获取观测并决策,从而提升紧急情况下的反应能力。
并行战场机制可同时运行多个仿真环境,有效提高数据吞吐量,加速训练。