小模型媲美大模型
从大语言模型渐进蒸馏知识,使轻量学生模型在捆绑生成任务上以极低推理开销逼近教师模型性能。
Kaidong, Feng · Sun, Zhu · Yang, Jie · 方慧 · Qu, Xinghua · 刘文远
ACM Transactions on Information Systems 2026
从原始数据渐进提取频繁模式、形式化规则和深度思考,从不同层面捕捉教师知识。
结合上下文学习和监督微调,充分利用蒸馏知识进行领域适配,提高学生模型效率。
在多个真实世界数据集上进行大量实验,表明知识形式、数量和利用方式共同影响性能。