CL-FusionBEV多模态融合检测器

点云与图像高效融合

一种用于自动驾驶的鸟瞰图视角下相机- LiDAR融合的三维目标检测算法,通过隐式学习视图变换与多模态交叉注意力机制,实现了对遮挡物与远处目标的稳定检测。

Shi, Peicheng · Zhiqiang, Liu · Xinlong, Dong · Yang, Aixi

Complex and Intelligent Systems 2024

参数信息

平均精度(mAP)
73.3 %
nuScenes 检测分数(NDS)
75.5 %
车辆检测准确率
89 %
行人检测准确率
90.7 %

技术优势

统一到 BEV 空间

通过隐式学习模块将相机视角转换到 BEV 空间,与 LiDAR BEV 特征对齐,避免前视图融合时的空间错位。

多模态注意力融合

多模态交叉注意力机制让相机和 LiDAR BEV 特征互相增强,解决简单拼接带来的模态不协同问题。

全局特征增强

BEV 自注意力机制弥补交叉注意力在全局推理上的不足,增强对远处和被遮挡目标的感知。

应用场景