整数化训练残差量化

4 位潜权重可训练

首个面向整数化训练的潜权重量化方案,通过残差量化和优化对偶量化器,最小化训练过程的量化扰动,并支持硬件友好实现。

Fei, Wen · 戴文睿 · 张良 · Zhang, Luoming · 李成林 · 邹君妮 · 熊红凯

IEEE Transactions on Pattern Analysis and Machine Intelligence 2025

参数信息

潜权重位宽
4 bit
微调大模型参数量
13 billion

技术优势

潜权重压缩到4位

通过残差量化消除潜权重与整数权重之间的相关性,抑制量化噪声,使训练过程几乎不受影响。

训练轨迹无偏

最优非均匀码本避免权重冻结,并保证训练轨迹在统计意义上与全精度潜权重一致,从而保持模型精度。

单卡微调13B大模型

借助4位潜权重显著降低内存占用,使得130亿参数的大语言模型可在单张GPU上微调,无需多卡或参数分片。

应用场景