音频辅助视频自适应框架

音频线索提泛化

利用音视频语义映射生成伪标签,并通过自适应迭代优化每个样本的测试时适应过程。

曾润浩 · Qi, Deng · Ronghao, Zhang · Niu, Shuaicheng · 陈健 · 胡希平 · 梁中明

IEEE Transactions on Circuits and Systems for Video Technology 2025

技术优势

不用新标注

用预训练音频模型对视频音轨分类,再通过大语言模型映射到视频标签,自动生成伪标签,全程无需人工标注。

每个样本自己定次数

根据损失变化和多视图一致性动态确定每个样本的最优适应迭代次数,避免固定迭代造成的过拟合或欠适应。

模型通用

在不同视频分类模型上均能一致提升适应性能,表明方法不依赖于特定网络结构。

应用场景