指示性视觉Transformer

端到端零样本检索

通过指示性特征选择器和并行特征适配器联合处理草图和图像,直接学习跨模态判别特征,省去多阶段训练。

Zhang, Haoxiang · 程德强 · 寇旗旗 · Asad, Mujtaba · He, Jiang

Advanced Engineering Informatics 2024

技术优势

全局特征更全

通过扩展ViT并使用指示性信息,有效捕获草图和图像中的全局特征,弥补CNN的不足。

无需多阶段训练

端到端设计避免了非端到端ViT模型的高昂训练成本。

跨模态特征更一致

并行特征适配器联合调制特征,强化类间关系学习,弥合模态和语义鸿沟。

多数据集效果显著

在Sketchy、Sketchy-No、QuickDraw和Tuberlin数据集上一致超越现有最佳方法。

应用场景