多文本联合生成框架

提升图文一致性

自适应调整多文本权重,生成更一致的视觉图像,缓解不完整描述带来的优化偏差。

周燕 · Qian, Jiechang · Zhang, Huaidong · 徐雪妙 · Huajie, Sun · 曾凡智 · Zhou, Yuexia

Pattern Recognition 2024

技术优势

缓解描述不一致

通过自适应加权聚合同一图像的多条描述,避免因单条描述不完整或相互矛盾而对生成器造成负面优化影响。

提升视觉一致性

利用联合描述特征训练生成器,使生成图像与多文本的视觉一致性显著提高。

重构匹配损失

重新设计多模态匹配损失,更准确地度量图像与多条文本描述之间的相似度,从而提升训练效果。

应用场景