语义感知差分隐私算法
剪枝无关词保精度
采用截断指数机制与尾部惩罚,仅对敏感词做扰动,在保持文本效用时仍提供正式隐私保证。
Wu, Zhouting · Luo, Sen Lin · Pan, Limin
Knowledge-Based Systems 2026
参数信息
- 准确率(SST-2)
- 85.09 %
- 防御成功率(SST-2)
- 75.51 %
- 准确率(QNLI)
- 87.04 %
- 防御成功率(QNLI)
- 78.40 %
- 准确率(ChnSentiCorp)
- 87.64 %
- 防御成功率(ChnSentiCorp)
- 51.09 %
- 准确率(IMDB)
- 85.80 %
- 攻击AUC(IMDB)
- 51.22 %
技术优势
只扰敏感词
UTEM区分敏感与非敏感词元,减少对非敏感词元的不必要扰动,从而保留原始语义。
剔除无关候选
利用距离截断和尾部惩罚机制修剪语义不相关的候选词,进一步提升效用。
有理论保证
给出了隐私和效用的理论推导,为UTEM建立了正式保证。
应用场景
- 文本隐私保护:在文本发布前对敏感词元加噪,防止隐私泄露
- 安全数据分析:提供带正式隐私保证的数据,支持安全分析
- 隐私保护NLP:在保护隐私的同时维持NLP任务准确率