4 位潜权重可训练
首个面向整数化训练的潜权重量化方案,通过残差量化和优化对偶量化器,最小化训练过程的量化扰动,并支持硬件友好实现。
Fei, Wen · 戴文睿 · 张良 · Zhang, Luoming · 李成林 · 邹君妮 · 熊红凯
IEEE Transactions on Pattern Analysis and Machine Intelligence 2025
通过残差量化消除潜权重与整数权重之间的相关性,抑制量化噪声,使训练过程几乎不受影响。
最优非均匀码本避免权重冻结,并保证训练轨迹在统计意义上与全精度潜权重一致,从而保持模型精度。
借助4位潜权重显著降低内存占用,使得130亿参数的大语言模型可在单张GPU上微调,无需多卡或参数分片。