人脸视觉-语言预训练模型

早期检索性能领先

该模型将人脸图像与其语义描述在特征层对齐,使检索系统能在用户仅勾画粗略轮廓时即返回高质量结果,显著优于传统基于完整手绘草图的方法。

Dai, Dawei · Shiyu, Fu · Yingge, Liu · 王国胤

Information Fusion 2024

技术优势

草稿即可检索

通过视觉语言预训练对齐人脸图像与语义,并对初始草图进行语义融合,即使只有局部细节的早期草稿也能取得高精度检索结果。

强泛化能力

所提方法在实际测试中表现出良好的泛化能力,表明其能够应对用户勾画方式的差异。

超越现有基线

实验结果证明该方法在早期检索性能上显著优于其他基线方法。

应用场景