多模态码本翻译模型

图文翻译不依赖OCR

通过码本直接关联图像与文本,无需级联OCR即可完成图文机器翻译。

Zhibin, Lan · Jiawei, Ye · Shiyu, Liu · 姚俊峰 · Huang, Degen · Su, Jinsong

Neural Networks 2025

技术优势

不用OCR

通过多模态码本直接关联图像和文本,翻译时无需先做OCR,从根源上避免识别错误影响后续翻译。

多阶段训练

利用双语文本、OCR数据集和TIMT数据集分阶段训练,充分开发不同数据资源,使模型在图文翻译任务上表现更优。

公开数据集

发布首个公开人工标注的中英图文翻译数据集OCRMT30K,并自动扩展中德版本,为后续研究提供基准。

应用场景