多模态提示动作检测网络

零样本超越STALE 5.1%

利用多模态提示与文本增强动作建模,实现未见动作的精确检测与定位。

Asif, Raza · Yang, Bang · 邹月娴

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

零样本检测增益
5.1 %

技术优势

对齐更好

在冻结的CLIP视觉和文本分支中插入可学习的逐层提示,并建立两者之间的强耦合,从而大幅提升跨模态对齐。

更准的先验

利用文本的简洁语义辅助计算类别无关的动作性分数,为动作分类和定位提供准确的先验信息。

成本更低

先在概念丰富的图像识别数据集(如ImageNet)上进行多模态提示学习,然后冻结提示,再进行时序动作检测微调,显著降低计算开销。

泛化更强

在ImageNet上学到的多模态提示在10个图像识别数据集上表现出优于其他方法的域泛化能力。

应用场景