多模态交互提升评估精度
该网络通过自监督时态解析对齐视觉与语义特征, 并利用多模态交互模块捕捉细粒度动作细节, 在动作质量评估中显著优于现有方法。
Gedamu, Kumie · 姬艳丽 · 杨洋 · 邵杰 · 申恒涛
IEEE Transactions on Circuits and Systems for Video Technology 2024
自监督时序解析模块能够从视频中自动生成子动作序列,无需对每个子动作进行人工标注即可学习动作的时序结构。
多模态交互模块促进不同模态特征之间的交互,从而增强对场景不变性细粒度动作细节的评估。
在四个广泛使用的动作质量评估数据集上均显著优于现有最佳方法,证明了所提方法的有效性和可行性。