自适应面板SpGEMM

异构加速大矩阵

通过CPU-GPU异构协作与自适应面板分配,提升大规模稀疏矩阵乘法的并行效率。

姚德中 · Sifan, Zhao · Tongtong, Liu · 吴刚 · Jin H.

Transactions on Architecture and Code Optimization 2025

参数信息

性能提升
2.25–7.21 ×

技术优势

负载更均衡

重排序与拆分算法消除非零元分布不均对负载和内存访问的影响,让各核心工作量更均匀。

并行度更高

带亲和性约束的自适应面板分配让异构核心计算重叠更好,减少互相等待。

通信开销被抵消

异步数据传输与计算重叠,让核心间数据搬运不拖慢整体速度。

性能最多7倍

相比现有最优方法,异构核心上大矩阵乘法的GFlops提升2.25至7.21倍,对多种稀疏结构都有效。

应用场景