多模态动作识别框架

音频-视频语义桥接

通过建立音频-视频标签语义字典,有效利用音频模态,在仅有视觉标注的数据集上提升人类动作识别性能。

Alfasly, Saghir Ahmed · 鲁坚 · 徐晨 · Yu, Li · 邹玉茹

Pattern Recognition 2024

技术优势

用音频补全视觉

通过语义音频-视频标签字典(SAVLD)将视频标签映射到最相关的音频标签,使预训练音频模型能够估计模态相关性并融合相关信息。

不相关音频自动丢弃

引入可学习的无关模态丢弃(IMD)机制,在融合前完全丢弃不相关的音频模态,避免噪声干扰。

用语言模型重排序

GPT-3 根据检测到的视觉对象标签和音频预测给出高层建议,对最终预测进行重排序,进一步提升准确率。

应用场景