混合动作多任务学习
采用混合离散与连续动作的深度强化学习,最大化长期吞吐量,相比无学习和常规DRL算法提升吞吐量并保证用户公平性。
Hu, Zhifeng · 韩充 · Deng, Yansha · 王旭东
IEEE Transactions on Vehicular Technology 2024
通过多任务学习,actor同时整合了actor-critic(离散动作)和DDPG(连续动作),同时优化子带分配与功率/子阵列比。
与无学习和常规DRL算法相比,DISCO在提升网络吞吐量的同时实现了良好的用户公平性。
DISCO的推理计算时间仅数百毫秒,可用于实际网络部署。