分布对齐鉴别器

低成本合成医疗数据

一支由私有数据训练、经知识蒸馏和差分隐私保护的鉴别器,从大模型生成的海量样本中筛出高价值合成数据,用于训练下游分类器。

宋亦平 · Tian, Zhiliang · Yang, Yuxin · 黄民烈 · 刘新旺 · 李东升

Neural Networks 2026

技术优势

合成质量不下降

将差分隐私从样本生成转移到样本判别,生成过程无需注入噪声,从而保持大语言模型生成样本的高质量。

低隐私预算可用

鉴别器的训练使用知识蒸馏和校准噪声,而DP导师以低隐私预算约束标签分布,使整体隐私预算保持较低,同时保证效用。

超越同类基线

在三个医疗文本分类数据集上,使用本文合成样本训练的分类器在效用上显著优于最先进的差分隐私微调基线。

应用场景