该框架利用细粒度文本表示与多尺度融合,有效抑制冗余并提升弱监督分割精度。
Hu, Xifeng · 曹艳坤 · Wei-feng, Hu · Wang, Shanshan · Mukhopadhyay, Subhas Chandra · Yu, Liu · 李华锋 · 李玉军 · 蔡青 · 刘志
Information Fusion 2026
通过专家知识引导逐步精炼文本特征,减少无关信息对同类像素的干扰。
在多尺度上融合细粒度文本提示与图像特征,提升模型对不同类别的区分能力。
在预训练Transformer中嵌入视觉状态空间自适应层,以较低计算量改善长距离依赖建模。