MAPIRL调度网络

实时安全决策

用双曲正切函数把安全约束解析嵌入演员网络,在实时决策中保证调度可靠性,并显著提升多智能体强化学习的收敛效率与可解释性。

Dou, Jiaming · 王小君 · Liu, Zhao · Yi, Han · 马威 · 和敬涵

IEEE Transactions on Industry Applications 2025

技术优势

决策不会越界

通过双曲正切函数将安全约束直接嵌入演员网络的输出层,模型预测的动作天然满足安全边界,无需事后修正或惩罚项。

收敛比普通RL更快

在相同多智能体环境中,MAPIRL 达到相同性能所需的训练轮数显著减少,加快部署迭代。

决策过程可解释

嵌入的物理知识让智能体学习到的策略具有明确物理对应,方便工程人员理解和信任模型输出。

应用场景