多维度语义对齐模型

图文匹配精度刷新

突破了传统单一维度语义对应的限制,通过动态多维度增强对应来更精确地学习图像与文本之间的语义相似度。

张坤 · Hu, Bo · Huatian, Zhang · Zhe, Li · Mao, Zhengdong

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

度量单位不再写死

引入模态内多维度聚合器,以迭代增强方式动态捕捉由层次化多维度组合而成的新度量单位,为相似度判断提供更丰富的判别信息。

对应关系可训练

通过带稀疏贡献度的跨模态增强对应学习,综合而高效地测定跨模态语义相似度,取代了固定的一对一维度对应。

多个数据集刷新SOTA

大量实验验证了方法在多个数据集上达到最优性能,可直接作为检索或跨模态识别任务的更强基线。

应用场景