多模式CNN加速
将不同卷积模式视为结构化稀疏,通过优化输入分块与引擎规模,在FPGA上实现高并行且灵活的卷积计算架构。
Yishuo, Meng · Jianfei, Wang · Xiang, Siwei · Hou, Jia · Zhijie, Lin · 梅魁志 · Yang, Chen
IEEE Transactions on Circuits and Systems I: Regular Papers 2025
将1×1、步长2、矩形等卷积模式视为结构化稀疏,用统一的稀疏计算引擎处理,无需为每种模式单独设计硬件。
通过优化输入分块大小和卷积引擎规模,在VC709上实现921.60至1382.40 GOPS的算力,适合高吞吐推理。
与先前的稠密/稀疏加速器相比,DSP效率提升1.22×至2.84×,在相同DSP资源下产出更高。