多步策略梯度预测控制器

无需模型

利用多步策略梯度强化学习直接从数据中学习预测控制策略,无需系统动力学模型。

杨新电 · 张皓 · 王祝萍 · 严怀成 · 张长柱

IEEE Transactions on Cybernetics 2023

技术优势

完全无需模型

算法设计不依赖系统动力学知识,只需离线与在线数据。

多步策略梯度保障最优

将预测控制建模为时域上多智能体的合作博弈,从理论上保证策略最优性。

神经网络实时执行

分别用神经网络逼近动作-状态值函数和控制策略,训练完成后即可在线部署。

应用场景