考虑反应延迟
在轨道追逃博弈中显式建模反应时间延迟,并训练出在此条件下仍能有效决策的智能体。
Zhao, Liran · Qinbo, Sun · 74572281 · 党朝辉
Engineering Applications of Artificial Intelligence 2025
将动作延迟纳入回合制马尔可夫决策过程,使训练出的智能体更符合真实任务约束。
算法能够在非线性轨道动力学和多种约束下学习有效策略,适用于实际轨道环境。
在二维和三维场景中均验证了有效性,展示了算法的通用性。