一次性训练即通用
面向开放词汇分割的通用框架,通过双潜在扩散过程深度融合文本与图像,实现对已知与未知类别的高精度统一分割。
Zheng, Hongtao · Yifei, Ding · Wang, Zilong · Huang, Xinyan
Information Fusion 2024
只需在全景数据集上训练一次,即可在所有开放词汇分割任务上推断,无需为每个任务重新训练或微调。
与传统全监督框架相比,SegLD在已知类别上的分割性能也显著占优,克服了开放词汇方法在已见类别上的常见短板。
采用两个并行的潜在扩散过程深度融合文本与图像信息,并按尺度聚合多尺度特征,提升跨模态表示质量。