多模态生成网络

语义一致性更强

该网络通过循环语义融合与词级判别器实现细粒度文本到图像生成,在多项基准上优于现有方法。

Bing, Yang · Xueqin, Xiang · Wangzeng, Kong · 张建海 · Yong, Peng

IEEE Transactions on Multimedia 2024

参数信息

Generates
256 images

技术优势

词级反馈更细致

判别器对每个词给出反馈,让生成图像在细节上更贴合文本,减少整体判别带来的语义偏差。

文本操纵更灵活

循环语义融合网络在多个融合块之间动态分配文本信息,使生成过程能整体调控文本影响,提升语义一致性。

应用场景