零样本多模态生成模型

免标注跨语言

通过共享隐空间对齐,统一处理图像、视频、文本到文本的生成,无需下游标注数据,支持中英德法四种语言。

Yang, Bang · Liu, Fenglin · 邹月娴 · Wu, Xian · Wang, Yaowei · Clifton, David Andrew

IEEE Transactions on Pattern Analysis and Machine Intelligence 2024

参数信息

零样本NLG任务数
12
支持语言数
4

技术优势

无需下游标注

训练时完全不用成对的数据-文本,仅靠未标注的单语和跨模态数据即可学习生成。

多模态统一

图像、视频、文本被映射到共享隐空间的对应坐标,同一框架处理三类任务。

四语种通用

英语、中文、德语、法语共享同一隐空间,跨语言生成不需要额外的语言特定模块。

应用场景