双深度Q网络

路线偏差降两成九

兼顾业务约束和骑手偏好,用更少的网络参数实现更准的包裹取送路线预测

Metages Molla, Gubena · 张玉利 · Ziqian, Ma · 马潇宇 · Yucai, Yang

IEEE Transactions on Consumer Electronics 2025

参数信息

位置平方偏差降低
29.14 %
编辑距离降低
48.33 %
完全匹配率提高
19.20 %
秩相关系数提高
6.67 %
网络参数减少
85 %
训练时间缩短
57.7 %

技术优势

不再忽略骑手偏好

通过集成旅行商模型与带时间窗的约束满足,以及带优先约束掩码的 i-DeepRoute 变换器,显式建模骑手个性化路线行为。

奖励不再稀疏

采用双奖励函数:完全匹配率(CMR)用于严格路线对齐,编辑距离(ED)提供渐进反馈,从而缓解强化学习中的奖励稀疏问题。

参数少八五成

相比纯深度学习方法,网络参数减少 85%,降低了模型部署和推理成本。

应用场景