零样本识别
该网络利用细粒度概念-描述对齐,显著提升第一人称视频中动作识别的准确性,无需训练数据即可识别新动作。
Dai, Guangzhao · 舒祥波 · Wu, Wenhao · Yan, Rui · 张嘉超
IEEE Transactions on Multimedia 2024
通过概念-描述对齐,模型无需在目标动作数据上训练即可识别第一人称视频中的新动作。
利用 SAM 将全局图像解析为部件级上下文概念,结合 ChatGPT 生成的句子级文本描述,实现更细致的视觉-语言匹配。
在三个大规模数据集上均取得最优准确率,其中 EPIC-KITCHENS-100 上提升 9.4 个百分点。