弱监督三维场景图生成网络

无需实体标注

通过视觉语言模型辅助的伪标签策略,该网络在仅需图像级标注的条件下,实现了与全监督方法相当的三维场景图生成性能。

Xu, Wang · Yifan, Li · Zhang, Qiudan · 邬文慧 · Mark Junjie, Li · Lin, Ma · 江健民

IEEE Transactions on Multimedia 2024

技术优势

无需实体标注

利用大规模视觉语言模型对齐文本和2D图像的能力,结合2D图像与3D点云的天然对应关系,只需图像级标签即可生成伪标签进行训练。

性能媲美全监督

在多个数据集上的大量实验表明,该方法取得了与当前先进全监督方法相当的结果。

自动建立跨模态对应

通过相机内外参数建立3D点云到2D图像的对应关系,再利用视觉语言模型对齐图像与文本,从而间接实现3D实例与文本标签的对应。

应用场景