U2ENet单目三维视觉定位网络

单目多目标定位

用单目图像实现多目标视觉定位,突破了传统方法依赖点云和两阶段检测的限制。

Keyu, Guo · 76908326 · Yongle, Huang · Hongli, Hu · Xiangyu, Song · 孙士杰 · Yi, Zhou · 宋焕生 · Strisciuglio, Nicola

Information Fusion 2026

技术优势

单目即可定位

网络直接从单目图像进行 3D 视觉定位,无需点云数据,因此可以部署在普通相机上,省去激光雷达等传感器。

一个模型多目标

单个模型同时处理单目标和多目标定位,无需为不同任务切换模型或流水线。

端到端免检测

省去两阶段范式中的候选物体检测步骤,直接从图像与文本预测目标位置,简化推理流程。

性能全面领先

在 Rope3DRefer 数据集上,该方法在所有难度级别和指标上均超过现有的点云基线和单目基线。

应用场景