音频-视频语义桥接
通过建立音频-视频标签语义字典,有效利用音频模态,在仅有视觉标注的数据集上提升人类动作识别性能。
Alfasly, Saghir Ahmed · 鲁坚 · 徐晨 · Yu, Li · 邹玉茹
Pattern Recognition 2024
通过语义音频-视频标签字典(SAVLD)将视频标签映射到最相关的音频标签,使预训练音频模型能够估计模态相关性并融合相关信息。
引入可学习的无关模态丢弃(IMD)机制,在融合前完全丢弃不相关的音频模态,避免噪声干扰。
GPT-3 根据检测到的视觉对象标签和音频预测给出高层建议,对最终预测进行重排序,进一步提升准确率。