稀疏大模型微调算法

极少参数保性能

在保持模型稀疏性的同时进行持续学习微调,仅引入0.011‰的额外参数,即可让压缩后的大语言模型在多任务上保持性能。

Yanzhe, Wang · Wang, Yizhen · Yin, Bao-Qin

Neurocomputing 2025

参数信息

额外参数比例
0.011 ‰
验证模型规模范围
7B-70B

技术优势

参数开销极小

只需引入0.011‰的额外参数,就能实现高效微调,几乎不增加存储和计算负担。

不牺牲稀疏性

微调过程始终维持模型的稀疏化结构,便于部署。

多任务持续学习

通过约束映射矩阵相似度,模型在学习新任务时不会遗忘旧任务。

应用场景