多模态交叉注意力融合网络

RGB-D姿态精度领先

直接处理RGB-D原始数据,利用同质多模态的自适应交叉注意力,实现对遮挡与复杂场景下6D姿态的更高精度估计。

Yi, Guo · 王斐 · 楚好 · Jindong, Yu · Han, Shuai

Information Fusion 2026

参数信息

姿态估计准确率
79.6 %
姿态估计准确率
97.2 %
姿态估计准确率
93.60 %

技术优势

无需点云转换

直接从原始RGB-D数据提取特征,避免了传统方法中先转换为点云的两分支结构,简化了流程并减少信息损失。

自适应融合

利用同质多模态特征的固有相似性,通过全局-局部嵌入和自适应交叉注意力实现更有效的融合,提升姿态估计精度。

遮挡下仍准确

在Occlusion-LineMOD遮挡数据集上达到79.6%的准确率,说明在物体被部分遮挡时仍能可靠估计姿态。

多场景验证

在三个流行基准数据集上均取得领先结果,并通过系统性消融分析验证了方法有效性。

应用场景