缺失模态下情绪识别更稳
用相似模态补全缺失数据,并把文本语义融入音视频表征,让多模态情感分析在模态不全时依然可靠。
Yuhang, Sun · 刘志中 · Sheng, Quan Z. · 初佃辉 · Yu, Jian · Hongxiang, Sun
Information Fusion 2024
预训练模型引导下将文本表征融入音视频表征,提升视频和音频的质量。
通过从全模态样本数据库中选择相似模态,实现缺失模态的有效补全。
文本、视频、音频分别分类后再融合决策,兼顾各模态独立表征。
在 CMU-MOSI 和 IEMOCAP 数据集上验证,性能超过现有最优基线。