准确率提升56.59%
利用归因分数识别潜在触发词,并结合外部语言模型判断中毒输入,实现稳健的文本后门防御。
Li, Jiazhao · Zhuofeng, Wu · Ping, Wei · Xiao, Chaowei · Vinod Vydiswaran, V. G.
2023
在预训练攻击防御场景下,平均准确率达到79.97%,较之前方法大幅提升。
防御过程不修改原模型,只通过归因分数和外部模型筛选可疑输入。
在预训练和后训练攻击防御下均提升,预训练场景下提升56.59%,后训练场景下提升3.99%。
在四个基准数据集上取得预测恢复的新最优性能。