少样本动作识别显著提升
利用视频内动态运动线索调制视觉语言表征,提升少样本动作识别性能。
方鹏飞 · Qiang, Xu · Zixuan, Lin · 薛晖
IEEE Transactions on Circuits and Systems for Video Technology 2025
不再依赖静态提示生成的文本特征,而是用长短期运动聚合模块捕捉视频内丰富的运动线索。
以运动线索为条件进行提示,增强文本特征与动作类别之间的语义关联。
用运动线索引导视觉特征细化,从而改善视频帧的局部表征。
在五个标准基准上的大量实验表明,该方法显著超越当前最先进的方法。