双层强化学习框架

面向无人机数据收集

将轨迹规划与调度分解为上下两层协同学习,上层用A2PO学习长期轨迹,下层用动态规划求解0-1背包调度,兼顾数据新鲜度与决策稳定性。

Kang, Fu · 赵清杰 · Lei, Wang

IEEE Internet of Things Journal 2026

技术优势

训练更稳

上层采用顺序更新与前智能体离策略校正,缓解非平稳性,提升样本效率。

调度更轻

调度问题被建模为时间约束的0-1背包问题,用动态规划在时间限制内快速求解。

AoI下降显著

在多种节点分布下,TL-RATS 相比 MAPPO、IPPO、MAT 等基线显著降低 AoI。

应用场景