精准识别模棱声音
利用视频特征帮助区分声音相似的物体,通过自适应注意力机制融合音视频信息,提升音频字幕的准确性。
Liu, Xubo · Huang, Qiushi · Mei, Xinhao · Liu, Haohe · 孔秋强 · Sun, Jianyuan · Li, Shengchen · Ko, Tom · Zhang, Yu · Lilian H., Tang · Plumbley, Mark D. · Kılıç, Volkan · Wang, Wenwu
2023
通过引入现成的视觉编码器提取视频特征,为音频字幕系统提供物体外观等上下文,从而区分声音相似的物体。
设计自适应注意力机制,在潜在空间中动态整合音视频上下文并消除冗余信息,提升描述质量。
在最大的音频字幕数据集 AudioCaps 上,所提方法在机器翻译指标上取得最优结果。