切换代价Q学习控制器

将切换代价纳入性能指标,通过Q学习和模糊函数逼近,实现无模型最优切换跟踪控制。

Xiang, Zhengrong · Pingchuan, Li · Chadli, M. · Zou, Wencheng

IEEE Transactions on Fuzzy Systems 2023

技术优势

考虑切换代价

将切换代价纳入性能指标,使最优切换策略不仅取决于跟踪误差,还取决于前一时刻的模式,从而避免频繁切换。

无需系统模型

提出的Q学习算法直接从实际系统数据中学习最优切换策略,不依赖系统动力学模型。

收敛性有证明

通过数学归纳法证明迭代Q函数收敛到最优值,确保算法理论可靠性。

应用场景