自解释DRL控制器

关键特征识别保真度提升50%

这种控制器不仅能达到与原神经网络控制器相当的决策性能,还能准确识别出对决策真正关键的状态特征,从而让深度强化学习系统的行为可解释、可审计。

Shi, Peng · Liu, Si · Dapeng, Zhi · Wang, Peixin · 张敏

Neural Networks 2026

参数信息

关键特征识别保真度提升
50.58 %
对抗攻击有效性提升
25.2 %
对抗扰动下奖励下降
8.7 %

技术优势

特征对齐更准

通过 DRL 训练,利用系统奖励作为反馈,直接在训练中纠正特征错位,使关键特征识别保真度最大化。

决策性能不降

训练出的自解释控制器达到与原神经网络控制器相当的决策性能,因此引入可解释性并不牺牲控制效果。

对抗鲁棒性更强

得益于更准确的特征对齐,面对显著对抗扰动时奖励仅下降8.7%,同时攻击有效性提升25.2%。

应用场景