宏布局强化学习网络

线长缩短14%

通过分层强化学习分解宏布局任务,模仿人类专家设计模式,在保持训练稳定的同时实现更优的线长和拥塞优化。

Zhentao, Tan · 穆亚东

Pattern Recognition Letters 2024

参数信息

平均线长降低率
9.29 %
最高线长降低率
14.25 %
测试基准数量
8

技术优势

奖励更稠密

通过计算每个episode的局部线长和拥塞差异来生成稠密奖励,缓解稀疏奖励问题。

搜索空间更小

采用分层强化学习框架,每个时间步分配子任务而非原始动作,减小了状态-动作搜索空间。

训练更稳定

分层框架和稠密奖励共同作用,解决了强化学习中训练不稳定的问题。

应用场景