无需模型
利用多步策略梯度强化学习直接从数据中学习预测控制策略,无需系统动力学模型。
杨新电 · 张皓 · 王祝萍 · 严怀成 · 张长柱
IEEE Transactions on Cybernetics 2023
算法设计不依赖系统动力学知识,只需离线与在线数据。
将预测控制建模为时域上多智能体的合作博弈,从理论上保证策略最优性。
分别用神经网络逼近动作-状态值函数和控制策略,训练完成后即可在线部署。