关键特征识别保真度提升50%
这种控制器不仅能达到与原神经网络控制器相当的决策性能,还能准确识别出对决策真正关键的状态特征,从而让深度强化学习系统的行为可解释、可审计。
Shi, Peng · Liu, Si · Dapeng, Zhi · Wang, Peixin · 张敏
Neural Networks 2026
通过 DRL 训练,利用系统奖励作为反馈,直接在训练中纠正特征错位,使关键特征识别保真度最大化。
训练出的自解释控制器达到与原神经网络控制器相当的决策性能,因此引入可解释性并不牺牲控制效果。
得益于更准确的特征对齐,面对显著对抗扰动时奖励仅下降8.7%,同时攻击有效性提升25.2%。