面向无人机数据收集
将轨迹规划与调度分解为上下两层协同学习,上层用A2PO学习长期轨迹,下层用动态规划求解0-1背包调度,兼顾数据新鲜度与决策稳定性。
Kang, Fu · 赵清杰 · Lei, Wang
IEEE Internet of Things Journal 2026
上层采用顺序更新与前智能体离策略校正,缓解非平稳性,提升样本效率。
调度问题被建模为时间约束的0-1背包问题,用动态规划在时间限制内快速求解。
在多种节点分布下,TL-RATS 相比 MAPPO、IPPO、MAT 等基线显著降低 AoI。