强化学习变形策略

学习最短飞行时间

一种自主决策飞行器变形的控制策略,通过分层解耦与渐进训练,在长时间任务中稳定学习到最短时间形态切换规律。

Baochao, Zhang · 郭杰 · Haoning, Wang · Shengjing, Tang

Aerospace Science and Technology 2024

技术优势

无需参考轨迹

奖励函数分解为主目标与子目标,解决稀疏奖励无参考决策问题,让智能体在没有人工参考的情况下学习。

训练加速

多阶段渐进训练从易到难逐步逼近真实环境,加速训练过程并促进收敛。

泛化能力强

在未训练场景中验证了泛化能力,表明策略可适应不同条件。

应用场景