免初始稳定策略的Q学习算法

免初值快速收敛

针对无需系统模型的线性二次调节问题,该算法不要求初始稳定控制策略,仅通过求解辅助系统即可单调收敛至最优解,并借助同伦技巧实现有限次迭代。

Wenwu, Fan · 熊军林

IEEE Transactions on Automation Science and Engineering 2025

技术优势

免初始稳定策略

所有提出的算法均不要求初始控制策略具有稳定性,避免了策略迭代算法中的严格初始条件限制。

有限次迭代收敛

通过引入基于Q学习的同伦方法,将原问题转化为辅助系统求解,可在有限次迭代内获得最优解,显著快于传统迭代算法。

单调收敛保证

针对辅助系统的Q学习算法被证明单调收敛至最优解,保证了学习过程的稳定性。

应用场景