稀疏奖励下胜率更高
一种两级强化学习框架,在保持原始任务奖励结构的同时,通过在战术层重标定轨迹奖励和在控制层采用渐进子任务课程,实现了更快收敛和更准确的飞行控制。
Hesong, Huang · 张琦 · 曾俊杰 · Hu, Yue · Li, Xinmeng · Yin, Quanjun
Engineering Applications of Artificial Intelligence 2026
通过轨迹级奖励重标定和双缓冲区优先采样,直接利用原始稀疏奖励中的高回报轨迹,不需要额外注入几何优势项,避免了奖励塑形对策略的偏置。
底层采用基于性能门控的渐进子任务课程,分别处理俯仰、航向和速度通道的不同响应特性,并在性能不达标时回滚,从而提升控制精度。
在相同稀疏奖励设置下,R2SP在与强DRL基线和规则基线的对抗实验中取得了更高的胜率。