对偶强化学习机制
针对带变速约束的能量感知分布式异构柔性流水车间调度问题,提出一种基于对偶强化学习机制选择局部搜索算子的协同进化算法。
赵付青 · Fumin, Yin · 王凌 · 于杨
IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024
采用对偶双重深度Q网络(DDQN)根据搜索状态动态选择局部搜索算子,避免了人工设计规则或随机选择带来的低效。
通过基于知识的混合初始化操作生成初始种群,利用问题特性提高初始解的质量,为后续搜索提供良好起点。
基于对抗生成学习设计全局搜索,增强算法探索解空间的能力,有助于跳出局部最优。
提出基于知识的速度调整策略和节能策略,针对问题特性同时降低总拖期和总能耗。