规划更稳,奖励更高
PB-PPO算法面向深空探测器任务规划,通过正交初始化与动态学习率策略,实现更稳定的训练过程与更高的任务奖励。
Yuheng, Qi · 谷德峰 · Liu, Yuan · 朱炬波 · Wang, Jian · Daoping, Liu
Aerospace Science and Technology 2024
在对比实验中,PB-PPO的奖励比对比算法高4.42%到26.81%,直接提升了任务规划的质量。
正交初始化让参数更新更可控,动态学习率策略加速收敛,即使规划大量机会目标,奖励也能稳定增长。
算法对机会目标有足够响应能力,在大量机会目标出现时仍能保持稳定奖励增长,避免了因新增目标导致的规划崩溃。