SA-PPO过程控制算法

平均奖励提升21.64%

用于缓解工业过程强化学习中的模型-装置失配问题,通过状态适配器对齐模拟与实际状态,提升控制策略的学习效率和稳定性。

Liang, Huiping · Xie, Junyao · Huang, Biao · 李勇刚 · 孙备 · 杨超

Reliability Engineering and System Safety 2025

参数信息

平均MSE提升
1.96 %
平均回报提升
21.64 %

技术优势

状态对齐缓解失配

通过状态适配器将模拟状态与真实状态对齐,避免仿真控制器部署到实际装置时因状态分布差异导致的性能下降。

回报标签更靠谱

固定时域回报替代传统的无限时域回报,为评论家网络提供真实标签,从而提升学习效率和稳定性。

平均奖励涨两成

在焙烧过程仿真中,SA-PPO的平均回报R比现有方法提升21.64%,验证了方法有效性。

应用场景