图像提示基础模型分割算法

免训练解决开放世界分割

该算法利用单张参考图像作为提示,通过视觉基础模型提取并匹配特征生成点提示,引导分割模型对目标物体进行分割,无需任何训练即可适用于开放世界场景。

Tang, Lv · Jiang, Pengtao · Haoke, Xiao · Bo, Li

International Journal of Computer Vision 2024

参数信息

数据集上
49.0 mIoU
数据集上
61.0 mIoU

技术优势

无需训练

利用 DINOv2 和 Stable Diffusion 等预训练视觉基础模型,通过图像提示直接分割,节省训练时间与计算资源。

灵活交互

用户只需提供一张包含目标概念的参考图像,即可对输入图像中的对应目标进行分割,无需精细标注。

即插即用

生成的点提示可直接引导 Segment Anything Model 完成分割,无需修改 SAM 本身。

通用性强

在 COCO、PASCAL VOC 等多个数据集上验证了开放世界分割效果,适用于各种视觉概念。

应用场景