轻量快,超越级联与现有端到端
通过端到端架构与模态对比学习,弥合文本与图像之间的模态鸿沟,避免级联错误传播和信息损失。
Ma, Cong · Xu, Han · Linghui, Wu · 张亚平 · 朝阳 · 周宇 · 宗成庆
IEEE/ACM Transactions on Audio Speech and Language Processing 2023
图像编码器直接输出文本特征,翻译在同一特征空间中完成,省去独立的识别步骤,避免级联错误传播和信息损失。
通过模态内和模态间对比学习,将图像特征拉近对应文本特征,远离不相关文本,从而弥合图像与文本之间的模态差距,使后续翻译模块能有效处理图像特征。
模型更轻且运算量更少,使得在资源受限设备上部署成为可能,同时保持高翻译精度。
在合成和真实世界评估集上,该模型均优于现有级联方法和最先进的端到端模型,证明其在不同数据分布下均有效。