互提示学习网络

跨任务性能大幅提升

在视觉语言模型中对齐文本提示与视觉提示,使两类提示相互促进,释放出更强的表示能力。

Sifan, Long · Zhao, Zhen · Yuan, Junkun · Tan, Zichang · Liu, Jiangjiang · Jingyuan, Feng · 王生生 · 王井东

International Journal of Computer Vision 2024

参数信息

新类平均准确率提升
4.79 %
调和均值提升
3.88 %

技术优势

文本提示更聚焦

将全局图像特征分解为多个细粒度语义,分别融入对应的文本 prompt token,避免所有 token 被同一个全局特征主导。

视觉提示用上文本

用当前图像的文本描述重组出视觉提示,引导图像分支关注与类别相关的表示,同时滤除文本中的冗余和负面类别语义。

应用场景