异构加速大矩阵
通过CPU-GPU异构协作与自适应面板分配,提升大规模稀疏矩阵乘法的并行效率。
姚德中 · Sifan, Zhao · Tongtong, Liu · 吴刚 · Jin H.
Transactions on Architecture and Code Optimization 2025
重排序与拆分算法消除非零元分布不均对负载和内存访问的影响,让各核心工作量更均匀。
带亲和性约束的自适应面板分配让异构核心计算重叠更好,减少互相等待。
异步数据传输与计算重叠,让核心间数据搬运不拖慢整体速度。
相比现有最优方法,异构核心上大矩阵乘法的GFlops提升2.25至7.21倍,对多种稀疏结构都有效。