多尺度语义交互
通过共享金字塔结构和空间感知伪监督,在不同网格分辨率之间建模语义关系,同时保持模型规模与普通Transformer相当。
Zhang, Haonan · Zeng, Pengpeng · 高联丽 · Lyu, Xinyu · Song J. · 申恒涛
IEEE Transactions on Circuits and Systems for Video Technology 2023
通过在不同网格分辨率间进行语义交互,解决了固定分辨率导致的尺度感知局限。
自适应地利用被打乱的空间信息,缓解了网格特征展平导致的空间信息丢失。
达到新SOTA的同时模型规模与vanilla Transformer相当,便于部署。
方法成功扩展到视频字幕任务,证明其实用性。