视听注意力音频字幕模型

精准识别模棱声音

利用视频特征帮助区分声音相似的物体,通过自适应注意力机制融合音视频信息,提升音频字幕的准确性。

Liu, Xubo · Huang, Qiushi · Mei, Xinhao · Liu, Haohe · 孔秋强 · Sun, Jianyuan · Li, Shengchen · Ko, Tom · Zhang, Yu · Lilian H., Tang · Plumbley, Mark D. · Kılıç, Volkan · Wang, Wenwu

2023

技术优势

会看就能分清

通过引入现成的视觉编码器提取视频特征,为音频字幕系统提供物体外观等上下文,从而区分声音相似的物体。

融合不冗余

设计自适应注意力机制,在潜在空间中动态整合音视频上下文并消除冗余信息,提升描述质量。

成绩说话

在最大的音频字幕数据集 AudioCaps 上,所提方法在机器翻译指标上取得最优结果。

应用场景