零样本超越STALE 5.1%
利用多模态提示与文本增强动作建模,实现未见动作的精确检测与定位。
Asif, Raza · Yang, Bang · 邹月娴
IEEE Transactions on Circuits and Systems for Video Technology 2024
在冻结的CLIP视觉和文本分支中插入可学习的逐层提示,并建立两者之间的强耦合,从而大幅提升跨模态对齐。
利用文本的简洁语义辅助计算类别无关的动作性分数,为动作分类和定位提供准确的先验信息。
先在概念丰富的图像识别数据集(如ImageNet)上进行多模态提示学习,然后冻结提示,再进行时序动作检测微调,显著降低计算开销。
在ImageNet上学到的多模态提示在10个图像识别数据集上表现出优于其他方法的域泛化能力。