攻效显著提升
面向预训练语言模型,以对比学习与特征空间隔离提高不可见文本后门攻击的性能与鲁棒性。
Hao, Fu · Liu, Ming · 李熔盛
IEEE Transactions on Information Forensics and Security 2025
监督对比学习通过参数共享增强辅助任务对中毒样本的学习能力,从而提升后门攻击的有效性。
框架对基于微调策略的防御具有鲁棒性,在多种特殊攻击场景下表现良好。
提出零毒化攻击方法,无需污染目标任务的训练数据即可间接实现后门嵌入。