共享指数浮点FPGA加速器

免微调精度对齐

浮点精度不损失硬件效率,让FPGA上的DNN推理兼具浮点精度与定点能效。

赵文哲 · Qiwei, Dang · Xia, Tian · Jingming, Zhang · 郑南宁 · 任鹏举

IEEE Transactions on Circuits and Systems I: Regular Papers 2023

参数信息

推理性能
4.072 TFlops
DSP级联深度
16

技术优势

免微调

在超分辨率、图像去噪等难以量化的网络上,无需重新训练即可保持与原生浮点一致的精度。

存储密度对齐int8

浮点数据格式占用与8位定点相同的存储空间,不增加片上存储开销,保持带宽友好。

DSP级联翻倍

通过改进乘加结构,DSP级联深度从7增加到16,缓解浮点累积延迟,提升计算吞吐。

性能超过官方DPU

在Xilinx ZU9P上以250 MHz达到4.072 TFlops,高于此前工作及Xilinx官方DPU。

应用场景