跨语言图文检索新SOTA
首次将预训练模型的多模态与多语言能力统一,在多项多语任务中取得最佳性能。
张亮 · Ruan, Ludan · Hu, Anwen · 金琴
Machine Intelligence Research 2023
模型不再局限于英语,能够处理多种语言的视觉-语言任务,拓宽了应用范围。
CLIP4VLA 将音频模态纳入框架,实现视觉、语言和音频的统一建模。
在多语言视觉-文本检索、视觉问答和图像描述基准上取得最优性能。