PB-PPO任务规划算法

规划更稳,奖励更高

PB-PPO算法面向深空探测器任务规划,通过正交初始化与动态学习率策略,实现更稳定的训练过程与更高的任务奖励。

Yuheng, Qi · 谷德峰 · Liu, Yuan · 朱炬波 · Wang, Jian · Daoping, Liu

Aerospace Science and Technology 2024

参数信息

奖励提升幅度
4.42 %
奖励提升幅度
6.78 %
奖励提升幅度
18.32 %
奖励提升幅度
26.81 %

技术优势

奖励更高

在对比实验中,PB-PPO的奖励比对比算法高4.42%到26.81%,直接提升了任务规划的质量。

训练更稳

正交初始化让参数更新更可控,动态学习率策略加速收敛,即使规划大量机会目标,奖励也能稳定增长。

能抓机会目标

算法对机会目标有足够响应能力,在大量机会目标出现时仍能保持稳定奖励增长,避免了因新增目标导致的规划崩溃。

应用场景