双侧可伸缩Transformer

单模型弹性适配多平台

同一份权重训练一次,即可按需裁剪出不同宽度和深度的子模型,性能与完整模型相当。

余宙 · Zitian, Jin · 俞俊 · Mingliang, Xu · Hongbo, Wang · 范建平

IEEE Transactions on Multimedia 2023

参数信息

移动端推理延迟
60 ms

技术优势

训练一次即可

BST 框架可无缝集成到任意基于 Transformer 的 VQA 模型中,单次训练即可得到多种宽度和深度的子模型,无需为每个平台单独训练。

应用场景