端侧ViT延迟降3.3倍
一种面向移动设备的视觉Transformer自适应分割与卸载协同推理方法,通过精细拆分、回归预测与在线优化,在真实原型上显著降低多种先进模型的推理延迟。
Sifan, Zhao · Tongtong, Liu · Jin H. · 姚德中
IEEE Transactions on Mobile Computing 2025
针对视觉 Transformer 结构引入细粒度切割技术,能更灵活地分配计算任务,减少冗余计算。
基于 Auto Regression 模型预测分区延迟并动态卸载,适应不同设备和网络条件。
在实际原型实验中将四种最先进模型的推理延迟降低了 2.2 至 3.3 倍。