跨模态对齐提升
通过双流语义增强和模态语义对比加权,在文本、音频和视觉模态间实现更完整的语义建模与对齐。
Ruixia, Duan · Zherui, Li · 易鹏飞 · Rui, Liu · Dong, Jing
Multimedia Systems 2026
文本语义被显式迁移到音频和视觉模态,同时文本自身的细粒度表征也得到精化,使多模态表示更完整。
对比学习时动态强调语义相似对,让不同模态中表达同一情感的信息拉得更近。
在两个常用多模态情感基准上,多数评估指标都超过现有模型。