多更新深度强化学习算法

收敛快且公平

该算法通过多更新机制降低动作空间维度,并引入α公平效用函数,使计算卸载在保证用户间公平性的同时实现长期平均优化,适用于计算和存储资源受限的边缘计算场景。

Hao, Hao · 许长桥 · 张伟 · Yang, Shujie · Muntean, Gabriel Miro

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

公平性有理论保证

算法对α公平效用函数收敛,因此不同用户的服务时延差异受到控制,不会出现偏向少数用户的情况。

应用场景