多任务迁移深度强化学习
通过共享公共知识层,该算法能快速适配新环境下的无人机数据收集任务,无需从头训练。
Yi, Mengjie · 王玺钧 · 刘娟 · 张琰 · 侯蓉晖
IEEE Internet of Things Journal 2023
技术优势
新环境无需从头训练
利用公共知识层,策略可在不同网络规模和拓扑之间迁移通用知识,无需为每个新环境单独训练。
适应新环境表现更优
仿真结果表明,该方法能适应新环境,并且性能优于基准算法。
应用场景
- 无人机数据收集:为无人机提供适应不同环境的策略,无需重复训练即可执行数据收集任务。
- 物联网数据新鲜度优化:通过优化轨迹与调度,降低平均信息年龄,保证数据新鲜度。
- 自主无人机控制:实现无人机自主决策,平衡充电与任务执行,延长持续工作时间。
- 具身智能策略迁移:利用公共知识层,在相似环境间迁移策略,加速新任务学习。