多语种多模态预训练模型

跨语言图文检索新SOTA

首次将预训练模型的多模态与多语言能力统一,在多项多语任务中取得最佳性能。

张亮 · Ruan, Ludan · Hu, Anwen · 金琴

Machine Intelligence Research 2023

技术优势

支持多语言

模型不再局限于英语,能够处理多种语言的视觉-语言任务,拓宽了应用范围。

扩展至音频

CLIP4VLA 将音频模态纳入框架,实现视觉、语言和音频的统一建模。

多项任务最优

在多语言视觉-文本检索、视觉问答和图像描述基准上取得最优性能。

应用场景