线长缩短14%
通过分层强化学习分解宏布局任务,模仿人类专家设计模式,在保持训练稳定的同时实现更优的线长和拥塞优化。
Zhentao, Tan · 穆亚东
Pattern Recognition Letters 2024
通过计算每个episode的局部线长和拥塞差异来生成稠密奖励,缓解稀疏奖励问题。
采用分层强化学习框架,每个时间步分配子任务而非原始动作,减小了状态-动作搜索空间。
分层框架和稠密奖励共同作用,解决了强化学习中训练不稳定的问题。