相似模态补全模型

缺失模态下情绪识别更稳

用相似模态补全缺失数据,并把文本语义融入音视频表征,让多模态情感分析在模态不全时依然可靠。

Yuhang, Sun · 刘志中 · Sheng, Quan Z. · 初佃辉 · Yu, Jian · Hongxiang, Sun

Information Fusion 2024

技术优势

文本语义增强音视频

预训练模型引导下将文本表征融入音视频表征,提升视频和音频的质量。

相似样本补全缺失模态

通过从全模态样本数据库中选择相似模态,实现缺失模态的有效补全。

多模态决策级融合

文本、视频、音频分别分类后再融合决策,兼顾各模态独立表征。

在两大基准上优于SOTA

在 CMU-MOSI 和 IEMOCAP 数据集上验证,性能超过现有最优基线。

应用场景