模态对比学习端到端文本图像翻译模型

轻量快,超越级联与现有端到端

通过端到端架构与模态对比学习,弥合文本与图像之间的模态鸿沟,避免级联错误传播和信息损失。

Ma, Cong · Xu, Han · Linghui, Wu · 张亚平 · 朝阳 · 周宇 · 宗成庆

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

技术优势

单一模型完成翻译

图像编码器直接输出文本特征,翻译在同一特征空间中完成,省去独立的识别步骤,避免级联错误传播和信息损失。

跨模态特征对齐

通过模态内和模态间对比学习,将图像特征拉近对应文本特征,远离不相关文本,从而弥合图像与文本之间的模态差距,使后续翻译模块能有效处理图像特征。

推理速度更快

模型更轻且运算量更少,使得在资源受限设备上部署成为可能,同时保持高翻译精度。

性能超越现有系统

在合成和真实世界评估集上,该模型均优于现有级联方法和最先进的端到端模型,证明其在不同数据分布下均有效。

应用场景