偏差补偿Q学习算法

40%攻击下仍学最优策略

面向控制通道拒绝服务攻击,通过偏差补偿消除Q函数更新中的期望计算,实现直接数据驱动的最优跟踪控制,无需系统动力学知识。

Liu, Guangyu Justin

ISA Transactions 2026

参数信息

攻击容忍率
40 %

技术优势

无需系统动力学

所提方法除已知系统结构外不需要系统动力学知识,在无模型框架下进行数据驱动的Q学习。

消除期望计算

偏差补偿机制处理控制输入丢失,从而无需在Q函数更新中显式计算期望,简化了实现并提高数据效率。

任意策略采数

支持在任意行为策略下收集数据,提高了数据效率和实际应用的灵活性。

应用场景