无需标注即可定位声源
这是一个无需人工标注即可定位声源的学习框架,利用迭代对比学习自动生成伪标签并逐步减弱非声源区域与参考音频的相关性,性能优于现有方法。
Lin, Yanbo · Tseng, Hungyu · Lee, Hsinying · Lin, Yenyu · Ming-Hsuan, Yang
Computer Vision and Image Understanding 2023
方法从视频中自动挖掘音视频伪标签,无需任何人工标注即可进行学习。
每轮迭代利用上一轮预测的定位图和音频语义关系更新伪标签,逐步提升定位精度。
通过迭代训练逐步减弱非发声区域与参考音频的相关性,增强定位精准度。