组共享持续学习微调器

免掩码更新

专为稀疏大语言模型设计的持续学习微调方法,通过权重训练而非掩码更新来保持稀疏性并缓解灾难性遗忘,同时将正则化计算复杂度从二次方降至线性。

Yanzhe, Wang · Yin, Bao-Qin

Neurocomputing 2026

参数信息

正则化计算复杂度降低
2

技术优势

掩码不再改

GCL 只更新权重,稀疏掩码保持固定,既维持模型稀疏性,又避免启发式掩码调整带来的次优解。

复杂度降次

正则化计算复杂度由 O(N²) 降到 O(N),不再需要 Hessian 矩阵,让大规模模型的正则化变得可承受。

持续微调不忘

通过模拟突触可塑性的梯度正则项约束参数更新,缓解跨任务微调时的灾难性遗忘。

各种稀疏都兼容

同时支持非结构化稀疏和 N:M 结构化稀疏,可直接嵌入现有剪枝流程。

应用场景