深度音视频融合跟踪网络

多模态融合强鲁棒

通过视觉引导声学建模与跨模态注意力,在统一空间内深度交互音视频特征,显著提升复杂场景下的说话人跟踪精度。

Li, Yidi · 刘宏 · Yang, Bing

IEEE Transactions on Multimedia 2024

技术优势

声学地图更准

利用相机模型将视觉观测投影到声学空间,构建增强的声学地图,减少声学定位的模糊性。

多模态交互更深

引入跨模态注意力模块联合建模多模态上下文和交互,使音频和视觉特征的相关信息在融合过程中进一步交互。

多人跟踪更稳

质量感知模块评估多模态观测的可靠性,在复杂场景下提高多说话人跟踪的鲁棒性。

应用场景