文本引导语义分割
通过语言描述提示CLIP,为高分辨率遥感影像生成语义上下文,实现跨模态特征融合,提升分割精度。
Shijie, Zhang · Bin, Zhang · 吴云韬 · Zhou H. · Jiang J. · Ma J.
IEEE Transactions on Geoscience and Remote Sensing 2024
利用CLIP提取文本信息指导视觉模型区分类别,无需额外人工标注即可提升判别能力。
设计跨模态特征融合模块,集成语言与视觉语义特征,确保模态间语义一致性。
利用额外真实文本细化模糊查询特征,进一步挖掘文本数据的潜力。