双步映射动作识别模型

视觉骨骼协同

该模型通过视觉-骨骼协同学习补偿动作识别中缺失的连续运动信息,并结合语义映射策略,使视频大语言模型能更准确地识别动作。

陈肖宇 · 许万茹 · 阚世超 · 张琳娜 · Jin, Yi · 岑翼刚 · 李浥东

IEEE Transactions on Circuits and Systems for Video Technology 2025

技术优势

不增加token长度

利用人体关键点补偿运动细节,输入大模型的token数保持不变,不会带来额外计算开销。

能提取动作描述

通过动词名词匹配和全文本匹配两种方法从文本中提取相关动作描述,帮助模型建立视觉与语义的对应。

训练数据带语义

专门构建语义动作识别数据集,使训练数据天然包含动作细节,让模型更好地学会动作识别。

应用场景