CLIP驱动Transformer

类别感知定位

通过类别感知注意力与语义增强,在仅图像级标签下实现更准确的目标定位。

陈志伟 · Shen, Yunhang · 曹刘娟 · 张声传 · 纪荣嵘

IEEE Transactions on Pattern Analysis and Machine Intelligence 2025

技术优势

定位更准

通过类别感知的注意力图,聚焦于类别相关的目标区域,而非所有显著区域。

语义更丰富

引入CLIP模型,将图像和文本的语义特定表示整合到自注意力图中。

应用场景