多模态提示融合ViT

多模态指令高效适配

通过融合文本与图像类别的多模态提示指令微调视觉Transformer,系统提升了下游多任务性能与领域适应性。

Xiao, Zhenxiang · Chen, Yuzhong · Junjie, Yao · 张路 · Zhengliang, Liu · Zihao, Wu · Yu, Xiaowei · Yi, Pan · Lin, Zhao · Chong, Ma · Liu, Xinyu · Liu, Wei · Li, Xiang · 袁奕萱 · Shen, Dinggang · Zhu, Dajiang · 尧德中 · Liu, Tianming · 蒋希

Information Fusion 2024

技术优势

多任务一致提升

通过融合文本与图像提示,模型在分类、分割、图像描述、目标检测上都获得了稳定提升,无需针对每个任务单独调整策略。

跨域适应更强

多模态提示为模型提供了更丰富的类别信息,使其在数据分布变化时表现更稳健。

应用场景