异构图强化学习分配模型

依赖感知多任务分配

该模型将任务与工人的复杂依赖关系统一表示为多关系图,并利用复合路径异构图注意力网络进行状态编码,进而通过强化学习生成最优分配策略。

Yong, Zhao · Zhu, Zhengqiu · 高宸 · 王恩 · 黄金才 · 王飞跃

IEEE Transactions on Mobile Computing 2026

技术优势

依赖感知更强

通过多关系图统一表示子任务依赖与技能要求,避免传统方法中人工特征工程对复杂关系的割裂。

状态建模更全

复合路径异构图注意力网络能捕获任务与工人之间的高阶关系,生成信息更丰富的状态嵌入。

决策优化更稳

利用PPO算法联合训练策略网络与图编码器,使分配策略在长期收益上更稳定高效。

应用场景