极少参数保性能
在保持模型稀疏性的同时进行持续学习微调,仅引入0.011‰的额外参数,即可让压缩后的大语言模型在多任务上保持性能。
Yanzhe, Wang · Wang, Yizhen · Yin, Bao-Qin
Neurocomputing 2025
只需引入0.011‰的额外参数,就能实现高效微调,几乎不增加存储和计算负担。
微调过程始终维持模型的稀疏化结构,便于部署。
通过约束映射矩阵相似度,模型在学习新任务时不会遗忘旧任务。