双侧可伸缩Transformer
单模型弹性适配多平台
同一份权重训练一次,即可按需裁剪出不同宽度和深度的子模型,性能与完整模型相当。
余宙 · Zitian, Jin · 俞俊 · Mingliang, Xu · Hongbo, Wang · 范建平
IEEE Transactions on Multimedia 2023
参数信息
- 移动端推理延迟
- 60 ms
技术优势
训练一次即可
BST 框架可无缝集成到任意基于 Transformer 的 VQA 模型中,单次训练即可得到多种宽度和深度的子模型,无需为每个平台单独训练。
应用场景
- 移动端VQA:在手机上直接回答图片问题,无需上传云端,保护隐私并降低延迟。
- 边缘计算:根据边缘设备可用资源动态选择子模型,在计算和精度之间取得平衡。
- 具身智能:让机器人等具身智能体在本地低延迟地理解视觉场景,实现实时交互。
- 机器人视觉问答:在机器人上部署轻量级 VQA 模型,响应人类指令并回答关于环境的问题。
- 无人机实时交互:无人机可实时回答操作员关于所拍摄图像的问题,无需地面站处理。