模糊强化学习容错控制器

未知动态下容错包容

针对异构非线性多智能体系统在未知动态和执行器故障下的最优包容控制问题,提出基于改进广义模糊双曲模型和强化学习的容错控制策略,通过零和博弈框架将故障与控制器建模为对立玩家,并利用固定时间辨识和经验回放实现高效在线学习。

刘东浩 · Mao, Zehui · 蒋彬 · Shi, Peng · 马亚杰

IEEE Transactions on Fuzzy Systems 2025

技术优势

无需精确模型

利用改进广义模糊双曲模型逼近未知动态,无需系统精确数学模型。

放松持续激励

固定时间辨识器结合经验回放,显著提升权重收敛性能,摆脱传统持续激励条件。

故障当作对手

将故障和控制器视为零和博弈对立双方,通过求解耦合HJI方程得到最优容错策略。

收敛有保证

利用Lyapunov方法证明包容误差和评价网络近似误差最终一致有界。

应用场景