文本引导逼真修复
利用描述性文本同时结合已知区域信息,在不规则孔洞遮挡下依然可以生成语义合理、可控且逼真的面部图像,解决了现有方法缺乏外部信息时难以补全新内容的问题。
Dandan, Zhan · Wu, Jiahao · Luo, Xing · 金枝
IEEE Transactions on Circuits and Systems for Video Technology 2024
利用描述性文本提供语义信息,即使上下文不足,也能为缺失的面部部件生成合理的新内容。
提出即插即用的多尺度多级跳跃融合模块,提取多尺度特征并将浅层特征在多个层级融入深层,充分利用已知区域信息。
多尺度文本-图像融合模块从局部和全局尺度将文本特征融入图像特征,弥合文本与视觉模态间的鸿沟。