学习最短飞行时间
一种自主决策飞行器变形的控制策略,通过分层解耦与渐进训练,在长时间任务中稳定学习到最短时间形态切换规律。
Baochao, Zhang · 郭杰 · Haoning, Wang · Shengjing, Tang
Aerospace Science and Technology 2024
奖励函数分解为主目标与子目标,解决稀疏奖励无参考决策问题,让智能体在没有人工参考的情况下学习。
多阶段渐进训练从易到难逐步逼近真实环境,加速训练过程并促进收敛。
在未训练场景中验证了泛化能力,表明策略可适应不同条件。