音视频协同更准
利用预训练音视频ViT,通过轻量适配器融合双模态特征,在野外动态表情识别上超越现有方法。
杨淳沨 · Bohui, Yang · Li, Jie · Xiaojia, Wang · 李建清 · Zhang, Yudong · 陈扬 · Cangelosi, Angelo · Xiang, Wentao
Information Fusion 2026
通过双模态融合适配器高效整合音视频特征,捕捉模态间复杂依赖关系,提升识别准确率。
利用适配器对预训练音视频ViT进行参数高效微调,无需重训整个模型,计算成本低。
跨模态时序建模捕捉表情动态变化,增强对动态情绪变化的识别能力。