长程依赖可控
针对多用户延迟约束调度中普遍存在的时变动态和部分可观测问题,提出一种结合循环神经网络记忆机制的数据驱动调度算法,无需系统先验信息即可同时保证资源与延迟约束。
Hu, Pihe · Yu, Chen · 潘玲 · 房智轩 · 肖甫 · 黄隆波
IEEE/ACM Transactions on Networking 2024
采用数据驱动的深度强化学习方法,不需要系统动态模型即可实时决策。
利用循环神经网络引入记忆机制,有效应对传感噪声和隐藏相关性导致的部分可观测问题。
通过用户级分解和节点级合并,将算法扩展到大规模多跳场景。