级联视觉语言引导框架

伪装目标分割更准

用视觉语言模型同时引导分割与分类,解决传统两阶段方法的域差距与边界模糊问题。

赵凯 · Wubang, Yuan · Zheng, Wang · Li, Guanyi · 朱晓强 · Fan, Dengping · Zeng, Dan

Computational Visual Media 2026

技术优势

分割更准

视觉语言模型特征作为显式提示引导SAM,使注意力集中于伪装区域,定位精度显著提升。

分类无域差

采用alpha通道作为软空间先验,保留全图上下文,避免硬裁剪带来的域差距,分类更准确且上下文感知。

一致且高效

分割与分类共享同一视觉语言模型,保证语义一致性并降低计算开销。

应用场景