低成本合成医疗数据
一支由私有数据训练、经知识蒸馏和差分隐私保护的鉴别器,从大模型生成的海量样本中筛出高价值合成数据,用于训练下游分类器。
宋亦平 · Tian, Zhiliang · Yang, Yuxin · 黄民烈 · 刘新旺 · 李东升
Neural Networks 2026
将差分隐私从样本生成转移到样本判别,生成过程无需注入噪声,从而保持大语言模型生成样本的高质量。
鉴别器的训练使用知识蒸馏和校准噪声,而DP导师以低隐私预算约束标签分布,使整体隐私预算保持较低,同时保证效用。
在三个医疗文本分类数据集上,使用本文合成样本训练的分类器在效用上显著优于最先进的差分隐私微调基线。