跨任务性能大幅提升
在视觉语言模型中对齐文本提示与视觉提示,使两类提示相互促进,释放出更强的表示能力。
Sifan, Long · Zhao, Zhen · Yuan, Junkun · Tan, Zichang · Liu, Jiangjiang · Jingyuan, Feng · 王生生 · 王井东
International Journal of Computer Vision 2024
将全局图像特征分解为多个细粒度语义,分别融入对应的文本 prompt token,避免所有 token 被同一个全局特征主导。
用当前图像的文本描述重组出视觉提示,引导图像分支关注与类别相关的表示,同时滤除文本中的冗余和负面类别语义。