眼镜墨镜口罩通吃
通过遮挡类型适配器和视觉语言提示,单一模型同时应对多种遮挡,无需为每种遮挡单独训练。
Yuxi, Liu · Luo, Guibo · Weng, Zhenyu · 朱跃生
IEEE Transactions on Circuits and Systems for Video Technology 2024
遮挡类型适配器响应视觉语言模型提示,为不同遮挡场景提供针对性处理,共享主干网络无需为每种遮挡单独训练模型。
生成器可以在无遮挡人脸图像上模拟多种遮挡类型,产生多样化的遮挡人脸图像用于训练,无需收集真实遮挡数据。
特征级知识蒸馏损失函数联合学习无遮挡和遮挡人脸特征,充分利用完整人脸信息来增强对遮挡样本的表示能力。
论文构建了 CALFW-SUNGLASSES 数据集,为墨镜遮挡场景提供额外的评估基准,促进后续研究。