鲁棒自适应多模态情感识别模型

任意模态缺失仍精准识别

针对不同缺失情况采用定制化处理,利用可用模态并减少噪声引入。

Ziming, Li · Liu, Yaxin · Chuanpeng, Yang · 周燕 · 虎嵩林

IEEE Transactions on Multimedia 2025

技术优势

能补全原始文本

A-T Completion模块基于编码器-解码器架构,从音频生成缺失的原始文本而非仅嵌入表示,从而捕捉更细腻的模态特征。

深度挖掘图文特征

T-V Fusion模块基于视觉-语言大模型,对文本和视觉特征进行深度提取与融合,提升识别效果。

优于现有模型

在三个公开数据集上的实验表明,ROSA在固定缺失率和固定缺失模态两种设置下均优于其他模型。

应用场景