吞吐量超GPU 1.5倍
面向全部Vision Transformer模型的可重构叠加处理器,用三层两级映射结构实现无需改硬件的模型切换。
Liu, Fang · Fan, Zimeng · Hu, Wei · Xu, Dian · Min, Peng · Jing, He · 何炎祥
Applied Soft Computing Journal 2024
在8位定点量化的Swin Transformer上,吞吐量比GPU实现高1.5倍,边缘设备上就能获得超过GPU的推理速度。
单个DSP的吞吐量是现有Transformer加速器的2.2到11.7倍,在有限的FPGA资源下能获得更强的计算能力。
三层两级映射结构封装了Vision Transformer共性,指令集和硬件架构支持灵活切换不同模型,无需修改硬件设计。