音频线索提泛化
利用音视频语义映射生成伪标签,并通过自适应迭代优化每个样本的测试时适应过程。
曾润浩 · Qi, Deng · Ronghao, Zhang · Niu, Shuaicheng · 陈健 · 胡希平 · 梁中明
IEEE Transactions on Circuits and Systems for Video Technology 2025
用预训练音频模型对视频音轨分类,再通过大语言模型映射到视频标签,自动生成伪标签,全程无需人工标注。
根据损失变化和多视图一致性动态确定每个样本的最优适应迭代次数,避免固定迭代造成的过拟合或欠适应。
在不同视频分类模型上均能一致提升适应性能,表明方法不依赖于特定网络结构。