多目标强化学习算法

灵活权衡能效与覆盖

该算法通过改进经验回放,解决了无线充电无人机任务采集中能效与任务数量两个目标间的动态权衡难题。

宋富洪 · 邓明森 · 邢焕来 · 刘衍平 · Ye, Fei · Xiao, Zhiwen

IEEE Transactions on Mobile Computing 2024

技术优势

动态偏好更快适应

采用基于迹的经验回放方案,减少回放缓冲区的偏差,使算法在偏好变化时能更迅速地调整策略。

更好的目标间平衡

实验结果表明,与多个算法相比,该算法在目标之间取得更有利的平衡,避免偏向单一目标。

样本效率更高

基于迹的回放机制提高了样本效率,使得在相同交互次数下学习效果更好。

应用场景