卫星路由深度强化学习算法 SDDRL-SR

低延迟高可靠

SDDRL-SR 利用 Dijkstra 算法监督训练来加速收敛,并在在线阶段通过两步收敛方法预测未来状态更新路由策略,实现了低时延数据传输。

Zhaolong, Ding · 刘会杰 · 田丰 · Yang, Zijian

2024

技术优势

收敛更快

利用 Dijkstra 算法进行监督训练,为深度强化学习提供更优的初始策略,减少训练时间。

预测未来状态

在线执行阶段设计了两步收敛方法,通过预测数据未来两步状态更新路由策略,适应时变拓扑。

延迟更低

实验结果表明平均时延优于 DQN、Dijkstra 和随机路由,满足低时延传输需求。

到达率更高

数据包到达率优于 DQN、Dijkstra 和随机路由,提升传输可靠性。

应用场景