伪装目标分割更准
用视觉语言模型同时引导分割与分类,解决传统两阶段方法的域差距与边界模糊问题。
赵凯 · Wubang, Yuan · Zheng, Wang · Li, Guanyi · 朱晓强 · Fan, Dengping · Zeng, Dan
Computational Visual Media 2026
视觉语言模型特征作为显式提示引导SAM,使注意力集中于伪装区域,定位精度显著提升。
采用alpha通道作为软空间先验,保留全图上下文,避免硬裁剪带来的域差距,分类更准确且上下文感知。
分割与分类共享同一视觉语言模型,保证语义一致性并降低计算开销。