积分强化学习一致控制器

免模型全系统

一种针对完全未知动力学非线性多智能体系统的最优一致性控制器,利用离策略积分强化学习与反步法结合,无需任何系统先验知识即可在线学习最优控制策略。

Yan, Lei · 刘治 · Philip Chen, Chun Lung Philip · 章云 · 吴宗泽

Neurocomputing 2025

技术优势

免除辨识器

所提算法采用执行器-评价器结构,但仅用单一学习规则更新权重,无需辨识器即可学习最优控制策略。

适用完全未知动力学

方案专为完全未知动力学系统设计,无需求解HJB方程或任何模型信息,仅依赖采样数据。

误差一致最终有界

最优权重向量的估计误差被证明一致最终有界,确保了闭环稳定性。

应用场景