目标感知视觉Transformer

实时无人机跟踪SOTA

通过最大化模板与特征表征间的互信息,缓解背景令牌削弱目标信息的问题,同时引入互信息知识蒸馏,实现精度与效率的更好权衡。

李水旺 · 73934830 · Xucheng, Wang · Zeng, Dan · 叶恒舟 · 赵启军

IEEE Transactions on Geoscience and Remote Sensing 2024

技术优势

目标信息不再被削弱

通过最大化模板图像与其特征表示之间的互信息,防止目标令牌在 Transformer 块中被大量背景令牌淹没。

更快更省算力

采用单流 ViT 避免额外的重关系建模模块,并通过互信息知识蒸馏进一步在精度和效率之间取得更好平衡。

多个基准上表现领先

在五个基准上的详尽实验表明,所提出的跟踪器达到了无人机跟踪的最先进性能。

应用场景