多粒度知识蒸馏
BLEU提升最高2.9
同时从词级和隐藏状态层面对齐教师模型,更完整地迁移翻译知识。
Yue, Zhou · Yuxuan, Yuan · Feng, Yanyan · 史晓东
Neural Networks 2025
参数信息
- BLEU提升(仅用MuST-C)
- +2.5 BLEU
- BLEU提升(对比端到端基线)
- +2.9 BLEU
- BLEU提升(对比级联系统)
- +1.9 BLEU
技术优势
词级权重动态调整
自适应词级蒸馏会根据翻译难度动态调整词级权重,优先处理难翻译的词,从而提升整体翻译质量。
跨模态隐藏状态对齐
通过对齐机器翻译教师和语音翻译学生的隐藏状态,弥合语音和文本之间的模态差距,实现更有效的跨模态知识迁移。
分阶段利用外部数据
多阶段框架逐步引入大规模外部 ASR 和 MT 数据,即使标注语音翻译数据有限,也能全面利用外部资源提升性能。
应用场景
- 语音翻译系统:直接用端到端模型获得更高翻译质量,省去级联系统的中间文本环节。
- 多模态机器学习:通过隐藏状态对齐弥合语音与文本模态差异,为跨模态迁移提供新思路。
- 知识蒸馏:多粒度蒸馏从输出分布和隐藏状态同时迁移知识,提升学生模型性能。
- 自然语言处理:蒸馏后的学生模型保留翻译能力,可直接用于下游 NLP 任务。