时空自适应融合Transformer

稀疏帧高精度估计

以稀疏采样帧恢复密集时序并同时关注时空信息,在低计算量下实现领先的三维人体姿态估计。

Feng, Hao · Zhong, Fujin · Hong, Yu · Hu, Jun · Yan, Yang

Image and Vision Computing 2024

参数信息

上实现
46.8 mm

技术优势

计算量大幅下降

通过 TDFR 模块从稀疏采样的 2D 帧恢复密集时序帧,避免了逐帧处理,从而显著降低计算复杂度。

精度达到顶尖水平

在 Human3.6M 上 MPJPE 达到 46.8 mm,与现有最佳方法相当甚至更优,同时计算复杂度更低。

关节运动更贴合

引入运动学相干损失,适应细微关节运动,提高姿态估计的保真度。

时空关联全捕获

通过自适应融合注意力机制同时关注空间和时间维度,而非仅关注其一,提升准确性。

应用场景