免标注跨语言
通过共享隐空间对齐,统一处理图像、视频、文本到文本的生成,无需下游标注数据,支持中英德法四种语言。
Yang, Bang · Liu, Fenglin · 邹月娴 · Wu, Xian · Wang, Yaowei · Clifton, David Andrew
IEEE Transactions on Pattern Analysis and Machine Intelligence 2024
训练时完全不用成对的数据-文本,仅靠未标注的单语和跨模态数据即可学习生成。
图像、视频、文本被映射到共享隐空间的对应坐标,同一框架处理三类任务。
英语、中文、德语、法语共享同一隐空间,跨语言生成不需要额外的语言特定模块。