时变策略迭代算法

最优控制快速收敛

该算法通过迭代更新值函数来逼近最优性能指标,并将神经网络嵌入实现结构,避免了每次迭代求解广义贝尔曼方程,为时变非线性系统的无限时域最优控制提供了有效解决方案。

朱广宇 · 李晓璐 · 孙然然 · Yang, Yiyuan · Zhang, Peng

IEEE/CAA Journal of Automatica Sinica 2023

技术优势

值函数必收敛

迭代值函数被证明非增收敛到贝尔曼方程最优解,避免振荡或发散。

免解贝尔曼方程

神经网络实现结构在每次迭代无需求解广义贝尔曼方程,降低在线计算量。

时变参数也适用

算法允许质量和摆杆长度等参数随时间变化,成功用于扭摆和倒立摆系统。

应用场景