无需实体标注
通过视觉语言模型辅助的伪标签策略,该网络在仅需图像级标注的条件下,实现了与全监督方法相当的三维场景图生成性能。
Xu, Wang · Yifan, Li · Zhang, Qiudan · 邬文慧 · Mark Junjie, Li · Lin, Ma · 江健民
IEEE Transactions on Multimedia 2024
利用大规模视觉语言模型对齐文本和2D图像的能力,结合2D图像与3D点云的天然对应关系,只需图像级标签即可生成伪标签进行训练。
在多个数据集上的大量实验表明,该方法取得了与当前先进全监督方法相当的结果。
通过相机内外参数建立3D点云到2D图像的对应关系,再利用视觉语言模型对齐图像与文本,从而间接实现3D实例与文本标签的对应。