低时延决策
结合深度强化学习与目标Q值上界,在动态信道和任务到达下做出低延迟卸载决策。
Wentao, Yang · 刘智斌 · 刘效武 · 马跃峰
Applied Soft Computing Journal 2024
比现有近似理想的基准方法计算加速超过99.6%,显著缩短卸载决策时间。
利用目标Q值最小上界解决策略更新中的价值过估计问题,使学习更稳定。
考虑无线信道时变性和任务到达不可预测性,能快速确定最佳卸载策略。