净化的置信分数

隐私防护低损耗

一种针对预测置信分数的净化方法,通过抑制成员与非成员数据在形状、分布和标签三个维度上的可区分性,实现对成员推理攻击的鲁棒防御,同时保持模型准确率几乎不变。

Yang, Ziqi · Yiran, Zhu · Jie, Wan · Chuxiao, Xiang · Tong, Tang · 王艺霖 · Ruite, Xu · Lijin, Wang · 张帆 · Xu, Jiarong · 秦湛

IEEE Transactions on Dependable and Secure Computing 2024

参数信息

分类准确率下降
0.7 %

技术优势

全方位抑制可区分性

Purifier 在个体形状、统计分布和预测标签三个维度上量化并减少成员与非成员之间的差异,而不是仅关注单一指标。

精度损失不到 0.7%

在大多数数据集上,净化后的模型分类准确率下降非常小,保持了原有模型的实用性。

防御效果优于已有方法

与之前的防御技术相比,Purifier 提供了更强的成员推理攻击防御效果。

扩展防御其他攻击

实验表明,Purifier 还能有效防御模型反演攻击和属性推理攻击。

应用场景