无模型在线RL控制器

无需系统模型,实时学习

提出一种无模型哈密顿-雅可比-贝尔曼方程,结合时间差分技术,实现未知非线性系统最优控制的实时在线学习,消除了对系统动力学的依赖。

Zhu, Liao · Wei, Qinglai · 郭平

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024

技术优势

无需系统模型

通过无模型哈密顿-雅可比-贝尔曼方程,完全消除了对系统动力学的依赖,适用于未知非线性系统。

实时在线学习

利用时间差分技术,仅使用当前和先前状态数据在线调谐,无需等待迭代收敛。

指数收敛

神经网络权重的拟合误差在每次迭代中指数收敛,保证学习速度。

应用场景