渐进式数据治理框架
跨设备噪声鲁棒治理
融合置信度共识与物理质量门控,在保留多源分布的同时提升模型校准与跨域泛化。
Bayu, Nadya Kusuma · Rama, Bastola Neupane · 李侃 · Ma, Xiang · Titok, Hariyanto
Expert Systems with Applications 2027
参数信息
- 分布内平衡准确率
- 86.24 %
- 分布外平衡准确率
- 90.88 %
- 教师模型校准误差
- 4.8 %
- 分布外负对数似然
- 0.169
- 每个来源保留比例
- 32.5 %
- 每个来源保留比例
- 66.7 %
- 保守重标注阈值下的分布内平衡准确率
- 86.78 %
- 激进重标注阈值下的分布外平衡准确率
- 91.25 %
技术优势
校准误差大幅降低
双教师置信度共识避免了单一教师错误预测的固化,教师模型ECE从12.4%–12.6%降至4.8%。
物理质量筛选前置
先用自编码器筛除物理降质图像,再进行语义评估,防止低质样本污染标注和模型训练。
跨域泛化稳定提升
在未见来源的数据上,平衡准确率比经验风险最小化高出3.48个百分点,且置信区间不含零。
保留多源样本分布
渐进分层策略让每个来源的保留比例在32.5%到66.7%之间,避免简单清洗导致某些设备或人群的数据被清空。
应用场景
- 医学影像数据清洗:自动剔除物理降质和标签噪声的眼底图像,提升诊断模型训练数据质量。
- 糖尿病视网膜病变筛查:清洗后的多源数据训练筛查模型,在不同设备上获得更可靠的分级结果。
- 多源数据质量评估:通过置信度共识和物理质量门控分层评估各来源数据,量化样本保留与校准质量。
- 模型校准与不确定性估计:清洗后的数据训练模型,显著降低校准误差并提供更可靠的预测置信度。