对抗式去偏
通过对抗框架学习统计不可分的潜在表征,在保留分类信息的同时消除受保护属性的偏差。
Huadong, Qiu · Feng, Rui · Ruoyun, Hu · 72290625 · Shaowa, Lin · Quanjin, Tao · 杨洋
AI Open 2023
学习到的潜在表征在不同受保护群体间统计不可区分,模型无法从表征中重建敏感属性,因此公平性不依赖后续处理。
框架对统计均等和个体公平提供理论保证,而不是仅靠经验验证。
在贷款审批、累犯预测等社会关键领域,该表征既能用于分类任务(如信用风险预测),又能阻断受保护群体信息,尤其适用于直接删除属性不够的情况。