任意模态缺失仍精准识别
针对不同缺失情况采用定制化处理,利用可用模态并减少噪声引入。
Ziming, Li · Liu, Yaxin · Chuanpeng, Yang · 周燕 · 虎嵩林
IEEE Transactions on Multimedia 2025
A-T Completion模块基于编码器-解码器架构,从音频生成缺失的原始文本而非仅嵌入表示,从而捕捉更细腻的模态特征。
T-V Fusion模块基于视觉-语言大模型,对文本和视觉特征进行深度提取与融合,提升识别效果。
在三个公开数据集上的实验表明,ROSA在固定缺失率和固定缺失模态两种设置下均优于其他模型。