太赫兹NOMA资源分配DNN

混合动作多任务学习

采用混合离散与连续动作的深度强化学习,最大化长期吞吐量,相比无学习和常规DRL算法提升吞吐量并保证用户公平性。

Hu, Zhifeng · 韩充 · Deng, Yansha · 王旭东

IEEE Transactions on Vehicular Technology 2024

技术优势

同时处理混合动作

通过多任务学习,actor同时整合了actor-critic(离散动作)和DDPG(连续动作),同时优化子带分配与功率/子阵列比。

提升吞吐量与公平性

与无学习和常规DRL算法相比,DISCO在提升网络吞吐量的同时实现了良好的用户公平性。

计算时间极短

DISCO的推理计算时间仅数百毫秒,可用于实际网络部署。

应用场景