语义视觉投影器

token减93%

利用SAM语义超像素压缩视觉token,在保持语义清晰的前提下大幅缩短序列长度,加速MLLM训练与推理。

Xiaobo, Yang · 龚小谨

ACM Transactions on Multimedia Computing, Communications and Applications 2026

参数信息

视觉token削减率
93 %

技术优势

token量减九成

通过SAM生成的语义超像素作为视觉词进行压缩投影,根据场景复杂度自适应决定token数量,大幅缩短序列长度。

性能不降反升

在referring image segmentation上不仅没有性能损失,还超越了现有的压缩视觉投影器方法。

保留细节信息

引入语义超像素位置嵌入增强对超像素几何和位置的感知,并设计聚合器保留超像素内部细节和全局上下文。

应用场景