跨模态交互强
在CLIP图像与文本编码器中注入语义/视觉引导的提示,并逐层传递提示信息,显著提升模型对跨数据集任务的泛化能力。
Junjie, Tao · Wang, Yuxia · Jie, Sun · Wenhong, Zhao · Shuwei, Shen · Zhang, Weifeng
Knowledge-Based Systems 2025
图像编码器中的提示由文本语义引导,文本编码器中的提示由视觉信息引导,使两侧编码器能更准确地关注任务相关特征。
在不同编码器层的提示令牌之间建立信息传递通道,使提示表示随深度逐步精化,模型能更精准地捕获任务感知信息。
在多个泛化测试中优于现有方法,尤其在跨数据集测试中取得显著提升,说明学到的提示对未见数据分布更鲁棒。