Transformer多模态位姿估计网络

跨模态深度融合

该网络利用Transformer逐像素特征提取和深度融合替代传统拼接,在多种公开数据集中表现优于同类方法。

Jia-Xin, Hong · 张洪博 · 刘景华 · 雷庆 · 杨丽洁 · 杜吉祥

Information Fusion 2024

技术优势

深度融合跨模态特征

在像素级特征上采用多种融合方法,而不是简单拼接,使互补的颜色和几何信息更有效地结合。

四数据集验证

在LineMOD、Occlusion Linemod、MP6D和YCB-Video上均优于同类方法,覆盖不同场景。

应用场景