点云与图像高效融合
一种用于自动驾驶的鸟瞰图视角下相机- LiDAR融合的三维目标检测算法,通过隐式学习视图变换与多模态交叉注意力机制,实现了对遮挡物与远处目标的稳定检测。
Shi, Peicheng · Zhiqiang, Liu · Xinlong, Dong · Yang, Aixi
Complex and Intelligent Systems 2024
通过隐式学习模块将相机视角转换到 BEV 空间,与 LiDAR BEV 特征对齐,避免前视图融合时的空间错位。
多模态交叉注意力机制让相机和 LiDAR BEV 特征互相增强,解决简单拼接带来的模态不协同问题。
BEV 自注意力机制弥补交叉注意力在全局推理上的不足,增强对远处和被遮挡目标的感知。