仅骨架输入即达最先进
从视觉语言知识中渐进蒸馏,学习任务无关的骨架动作表示,推理时不再需要额外模态。
Yang, Chen · Tian, He · Junfeng, Fu · 王玲 · Guo, Jingcai · Ting, Hu · 程洪
IEEE Transactions on Multimedia 2024
通过跨模态对比学习,利用视觉语言提示中的细粒度信息增强骨架表示,避免了昂贵的动作类别标注。
无需在自监督预训练中对骨架进行裁剪等变换,从而保持骨架的原始结构。
推理阶段只需要骨架数据作为输入,无需视觉语言提示,降低部署复杂度。
通过自知识蒸馏策略,从含噪声的骨架-视觉语言对中学习更好的表示。