读速5.4倍
基于GPU Direct Storage,为深度学习的张量保存与特征图传输提供自适应数据通路,显著提升I/O带宽并支持更大训练批次。
魏佳 · Zhang, Xing-Jun · 王龙翔 · 魏正
Transactions on Architecture and Code Optimization 2023
相较torch.save(),模型参数保存的读性能提升5.37倍,显著缩短模型加载时间。
中间特征图传输可支持20倍更大的训练批次大小,突破显存限制。
总读写速度相较torch I/O API提升2.96倍,整体训练吞吐提高。
根据张量大小和运行时上下文,自适应选择最优传输工具,无需人工调优。