递归软最大延迟深度确定性策略梯度算法

长程依赖可控

针对多用户延迟约束调度中普遍存在的时变动态和部分可观测问题,提出一种结合循环神经网络记忆机制的数据驱动调度算法,无需系统先验信息即可同时保证资源与延迟约束。

Hu, Pihe · Yu, Chen · 潘玲 · 房智轩 · 肖甫 · 黄隆波

IEEE/ACM Transactions on Networking 2024

技术优势

无需系统先验信息

采用数据驱动的深度强化学习方法,不需要系统动态模型即可实时决策。

处理部分可观测

利用循环神经网络引入记忆机制,有效应对传感噪声和隐藏相关性导致的部分可观测问题。

支持大规模多跳

通过用户级分解和节点级合并,将算法扩展到大规模多跳场景。

应用场景