多模态感知新基准
用时空Transformer从激光雷达与相机数据中学习统一鸟瞰图表示,现支持目标跟踪、矢量化建图等多项自动驾驶任务。
Zhiqi, Li · 王文海 · Hongyang, Li · 谢恩泽 · Chonghao, Sima · 路通 · Yu, Qiao · Dai, Jifeng
IEEE Transactions on Pattern Analysis and Machine Intelligence 2024
在 BEV 空间里用交叉注意力同时聚合点云和相机特征,避免了传统方法中复杂的多阶段特征转换。
同一个 BEV 表示可以用于目标跟踪、矢量化建图、占据预测和端到端自动驾驶等任务,减少重复开发。