多模态对齐网络 TEXTBIND

多轮图文交错指令跟随

仅需图像-文本对,即可生成多轮多模态指令对话数据,用于训练具备多轮交错多模态指令跟随能力的模型。

Li, Huayang · Li, Siheng · Cai, Deng · Wang, Longyue · Liu, Lemao · Watanabe, Taro · 杨余久 · Shi, Shuming

2024

技术优势

不用人工标注

框架只需图像-文本对,就能自动生成多轮多模态指令-响应对话,省去昂贵的人工标注步骤。

图文交错都没问题

所设计的 MIM 架构以语言模型为中心,能把图像编码器和解码器无缝衔接进来,直接处理图文交错的输入与输出。

应用场景