token减93%
利用SAM语义超像素压缩视觉token,在保持语义清晰的前提下大幅缩短序列长度,加速MLLM训练与推理。
Xiaobo, Yang · 龚小谨
ACM Transactions on Multimedia Computing, Communications and Applications 2026
通过SAM生成的语义超像素作为视觉词进行压缩投影,根据场景复杂度自适应决定token数量,大幅缩短序列长度。
在referring image segmentation上不仅没有性能损失,还超越了现有的压缩视觉投影器方法。
引入语义超像素位置嵌入增强对超像素几何和位置的感知,并设计聚合器保留超像素内部细节和全局上下文。