双决斗DQN传输调度器

新鲜度驱动资源配置

一种深度强化学习驱动的智能资源分配与重传策略,能在用户随机到达的多用户下行链路中实时决定功率分配与重传时机,实现网络信息新鲜度的确定性最优。

Kunpeng, Liu · 黎爱民 · Shaohua, Wu

2023

技术优势

实时决策

DRL模型在线输出功率与重传动作,无需等待离线求解或全局信息,适应随机到达与信道变化。

确定性最优

采用Double-Dueling DQN学习确定性策略,避免随机策略的方差,直接获得最优动作,提升AoI性能。

重传更灵活

提出的Retransmit-At-Will方案允许在任意时隙重传,不受固定协议限制,进一步降低信息年龄。

策略结构清晰

仿真揭示了重传策略的阈值结构,为实际系统设计提供了可解释的规则借鉴。

应用场景