知识引导跨模态对齐模型

语义鸿沟可弥合

用医学知识词典中的知识词作桥,引导视觉与文本特征对齐,突破数据驱动映射的语义鸿沟。

黄莉莉 · Yiming, Cao · Pengcheng, Jia · 李诚龙 · 汤进 · 李传富

IEEE Transactions on Multimedia 2024

技术优势

语义鸿沟可弥合

利用知识词引导跨模态特征对齐,让视觉和文本特征在统一语义空间对齐,而非仅靠数据驱动映射。

细节保留更好

渐进融合方案整合了融合特征与原始特征的优势,生成报告时能保留原始信息的重要细节。

双数据集验证

在IU-Xray和MIMIC两个公开数据集上的实验结果证明了方法的有效性。

应用场景