AttDef归因防御管道

准确率提升56.59%

利用归因分数识别潜在触发词,并结合外部语言模型判断中毒输入,实现稳健的文本后门防御。

Li, Jiazhao · Zhuofeng, Wu · Ping, Wei · Xiao, Chaowei · Vinod Vydiswaran, V. G.

2023

参数信息

预训练攻击防御平均准确率
79.97 %
后训练攻击防御平均准确率
48.34 %

技术优势

准确率提升56.59%

在预训练攻击防御场景下,平均准确率达到79.97%,较之前方法大幅提升。

无需重训模型

防御过程不修改原模型,只通过归因分数和外部模型筛选可疑输入。

兼顾两种攻击场景

在预训练和后训练攻击防御下均提升,预训练场景下提升56.59%,后训练场景下提升3.99%。

四个基准上最优

在四个基准数据集上取得预测恢复的新最优性能。

应用场景