CLaFS后门攻击框架

攻效显著提升

面向预训练语言模型,以对比学习与特征空间隔离提高不可见文本后门攻击的性能与鲁棒性。

Hao, Fu · Liu, Ming · 李熔盛

IEEE Transactions on Information Forensics and Security 2025

技术优势

攻效显著提升

监督对比学习通过参数共享增强辅助任务对中毒样本的学习能力,从而提升后门攻击的有效性。

防御更难防

框架对基于微调策略的防御具有鲁棒性,在多种特殊攻击场景下表现良好。

不脏数据也能攻

提出零毒化攻击方法,无需污染目标任务的训练数据即可间接实现后门嵌入。

应用场景