开放词汇视频分割模型

新类AP超40%

无需实例类别与身份标注,基于CLIP的编解码器网络,专为开放词汇视频实例分割设计,对新颖类别表现突出。

Wenqi, Zhu · 曹家乐 · 谢劲 · 杨双鸣 · 庞彦伟

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

LV-VIS 验证集 AP
32.2 %
LV-VIS 验证集 APn
40.2 %

技术优势

免标注训练

训练不需要实例类别和身份标注,省去了对大规模逐帧掩码和 ID 标注的依赖。

新类目更准

在 LV-VIS 验证集上 APn 达 40.2%,比 OV2Seg 高 23.9 个百分点,说明对训练时未见过的类别分割能力明显更强。

即插即用

基于冻结的 CLIP 图像编码器构建,无需微调 CLIP 本身,可直接适配不同骨干网络。

应用场景