多模态融合强鲁棒
通过视觉引导声学建模与跨模态注意力,在统一空间内深度交互音视频特征,显著提升复杂场景下的说话人跟踪精度。
Li, Yidi · 刘宏 · Yang, Bing
IEEE Transactions on Multimedia 2024
利用相机模型将视觉观测投影到声学空间,构建增强的声学地图,减少声学定位的模糊性。
引入跨模态注意力模块联合建模多模态上下文和交互,使音频和视觉特征的相关信息在融合过程中进一步交互。
质量感知模块评估多模态观测的可靠性,在复杂场景下提高多说话人跟踪的鲁棒性。