张量I/O加速工具

读速5.4倍

基于GPU Direct Storage,为深度学习的张量保存与特征图传输提供自适应数据通路,显著提升I/O带宽并支持更大训练批次。

魏佳 · Zhang, Xing-Jun · 王龙翔 · 魏正

Transactions on Architecture and Code Optimization 2023

参数信息

读性能提升
5.37 ×
训练批次大小提升
20 ×
总读写速度提升
2.96 ×

技术优势

读速提升数倍

相较torch.save(),模型参数保存的读性能提升5.37倍,显著缩短模型加载时间。

支持更大批次

中间特征图传输可支持20倍更大的训练批次大小,突破显存限制。

总带宽提升

总读写速度相较torch I/O API提升2.96倍,整体训练吞吐提高。

自动选工具

根据张量大小和运行时上下文,自适应选择最优传输工具,无需人工调优。

应用场景