多模态提升检测
通过体素-像素融合层,结合跨模态注意力机制,有效融合点云与图像特征,提升复杂环境下多类3D目标检测性能,特别擅长小目标和挑战性场景。
Chia-Hung, Wang · Chen, Hsueh Wei · Yi, Chen · Hsiao, Peiyung · Fu, Li-Chen
IEEE Transactions on Intelligent Transportation Systems 2024
通过体素-像素融合层利用几何关系对齐两种模态,并对小目标(如行人)进行更有效的特征增强,显著提升检测精度。
在体素-像素对上应用跨模态注意力机制,自适应地选择重要特征,实现两种模态信息的互补。
融合层可集成到基于体素的3D LiDAR检测器和2D图像检测器中,无需修改原有网络结构。
在KITTI基准上进行多类别3D检测,整体3D mAP取得优异表现,对挑战性类别(如行人)超越现有方法。