缓解模态鸿沟
将最优传输引入跨模态数据增强,使语音翻译训练不再受限于语音与文本之间的模态差异。
Yan, Zhou · 75881226 · 冯洋
2023
通过最优传输自适应地找到语音和文本序列之间的对齐,并在 token 级别混合来自不同模态的序列。
在 MuST-C 基准的 8 个翻译方向上平均 BLEU 达到 30.0,超过之前的方法。