40%攻击下仍学最优策略
面向控制通道拒绝服务攻击,通过偏差补偿消除Q函数更新中的期望计算,实现直接数据驱动的最优跟踪控制,无需系统动力学知识。
Liu, Guangyu Justin
ISA Transactions 2026
所提方法除已知系统结构外不需要系统动力学知识,在无模型框架下进行数据驱动的Q学习。
偏差补偿机制处理控制输入丢失,从而无需在Q函数更新中显式计算期望,简化了实现并提高数据效率。
支持在任意行为策略下收集数据,提高了数据效率和实际应用的灵活性。