空间金字塔变换器

多尺度语义交互

通过共享金字塔结构和空间感知伪监督,在不同网格分辨率之间建模语义关系,同时保持模型规模与普通Transformer相当。

Zhang, Haonan · Zeng, Pengpeng · 高联丽 · Lyu, Xinyu · Song J. · 申恒涛

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

多尺度实体感知

通过在不同网格分辨率间进行语义交互,解决了固定分辨率导致的尺度感知局限。

空间信息自适应恢复

自适应地利用被打乱的空间信息,缓解了网格特征展平导致的空间信息丢失。

参数不显著增加

达到新SOTA的同时模型规模与vanilla Transformer相当,便于部署。

视频任务可扩展

方法成功扩展到视频字幕任务,证明其实用性。

应用场景