性能平均2.6倍于MKL
通过序列化访存与规则分支提升稀疏矩阵向量乘法的流水线和缓存效率,显著缓解现代CPU上的性能瓶颈。
Xia, Tian · Gelin, Fu · Shaoru, Qu · Zhongpei, Luo · 任鹏举
Jisuanji Yanjiu yu Fazhan/Computer Research and Development 2023
通过创建序列化访问模式,提高了数据预取效率和缓存利用率。
通过生成规则的分支模式,使分支预测更准确,从而提高流水线效率。
灵活利用SIMD指令优化并行执行,充分利用CPU的计算资源。