双模态表情识别网络

音视频协同更准

利用预训练音视频ViT,通过轻量适配器融合双模态特征,在野外动态表情识别上超越现有方法。

杨淳沨 · Bohui, Yang · Li, Jie · Xiaojia, Wang · 李建清 · Zhang, Yudong · 陈扬 · Cangelosi, Angelo · Xiang, Wentao

Information Fusion 2026

参数信息

未加权平均召回率(DFEW)
67.52 %
加权平均召回率(DFEW)
78.28 %
未加权平均召回率(MAFW)
44.46 %
加权平均召回率(MAFW)
58.41 %

技术优势

音视频协同建模

通过双模态融合适配器高效整合音视频特征,捕捉模态间复杂依赖关系,提升识别准确率。

轻量微调

利用适配器对预训练音视频ViT进行参数高效微调,无需重训整个模型,计算成本低。

时序建模提升

跨模态时序建模捕捉表情动态变化,增强对动态情绪变化的识别能力。

应用场景