平均奖励提升21.64%
用于缓解工业过程强化学习中的模型-装置失配问题,通过状态适配器对齐模拟与实际状态,提升控制策略的学习效率和稳定性。
Liang, Huiping · Xie, Junyao · Huang, Biao · 李勇刚 · 孙备 · 杨超
Reliability Engineering and System Safety 2025
通过状态适配器将模拟状态与真实状态对齐,避免仿真控制器部署到实际装置时因状态分布差异导致的性能下降。
固定时域回报替代传统的无限时域回报,为评论家网络提供真实标签,从而提升学习效率和稳定性。
在焙烧过程仿真中,SA-PPO的平均回报R比现有方法提升21.64%,验证了方法有效性。