免掩码更新
专为稀疏大语言模型设计的持续学习微调方法,通过权重训练而非掩码更新来保持稀疏性并缓解灾难性遗忘,同时将正则化计算复杂度从二次方降至线性。
Yanzhe, Wang · Yin, Bao-Qin
Neurocomputing 2026
GCL 只更新权重,稀疏掩码保持固定,既维持模型稀疏性,又避免启发式掩码调整带来的次优解。
正则化计算复杂度由 O(N²) 降到 O(N),不再需要 Hessian 矩阵,让大规模模型的正则化变得可承受。
通过模拟突触可塑性的梯度正则项约束参数更新,缓解跨任务微调时的灾难性遗忘。
同时支持非结构化稀疏和 N:M 结构化稀疏,可直接嵌入现有剪枝流程。