公平表征生成器

对抗式去偏

通过对抗框架学习统计不可分的潜在表征,在保留分类信息的同时消除受保护属性的偏差。

Huadong, Qiu · Feng, Rui · Ruoyun, Hu · 72290625 · Shaowa, Lin · Quanjin, Tao · 杨洋

AI Open 2023

技术优势

从源头消除偏见

学习到的潜在表征在不同受保护群体间统计不可区分,模型无法从表征中重建敏感属性,因此公平性不依赖后续处理。

有理论保障

框架对统计均等和个体公平提供理论保证,而不是仅靠经验验证。

适合高风险场景

在贷款审批、累犯预测等社会关键领域,该表征既能用于分类任务(如信用风险预测),又能阻断受保护群体信息,尤其适用于直接删除属性不够的情况。

应用场景