仅骨骼即可交互识别
STAR在训练时利用RGB视频增强骨骼表征,推理时仅依赖骨骼序列,在多个基准上优于现有方法。
Yuhang, Wen · 刘梦源 · Tang, Zixuan · Yuan, Junsong · Sirui, Li · 丁北辰
IEEE Transactions on Multimedia 2026
在推理阶段只使用骨骼序列,保持高效率的同时保留了RGB增强带来的判别力。
通过将骨骼和RGB视频表示对齐到共享潜在空间,弥补了骨骼缺乏视觉信息的问题。