免模型在线学习
针对连续时间线性Itô随机系统的在线策略迭代Q学习算法,无需转移概率和系统矩阵,为马尔可夫跳变系统提供稳定控制。
Ming, Zhongyang · 张化光 · 王迎春 · Jing, Dai
IEEE Transactions on Cybernetics 2024
基于Lyapunov理论严格证明了离线策略迭代算法的收敛性和迭代控制律的可容许性,为在线学习奠定理论基础。
在电力系统仿真中验证了算法有效性,展示了该算法在实际应用中的潜力。