体素像素融合网络

多模态提升检测

通过体素-像素融合层,结合跨模态注意力机制,有效融合点云与图像特征,提升复杂环境下多类3D目标检测性能,特别擅长小目标和挑战性场景。

Chia-Hung, Wang · Chen, Hsueh Wei · Yi, Chen · Hsiao, Peiyung · Fu, Li-Chen

IEEE Transactions on Intelligent Transportation Systems 2024

参数信息

整体
3 D

技术优势

小目标检测更准

通过体素-像素融合层利用几何关系对齐两种模态,并对小目标(如行人)进行更有效的特征增强,显著提升检测精度。

跨模态注意力融合

在体素-像素对上应用跨模态注意力机制,自适应地选择重要特征,实现两种模态信息的互补。

即插即用于主流检测器

融合层可集成到基于体素的3D LiDAR检测器和2D图像检测器中,无需修改原有网络结构。

多类别检测全面提升

在KITTI基准上进行多类别3D检测,整体3D mAP取得优异表现,对挑战性类别(如行人)超越现有方法。

应用场景