多模态面部修复网络

文本引导逼真修复

利用描述性文本同时结合已知区域信息,在不规则孔洞遮挡下依然可以生成语义合理、可控且逼真的面部图像,解决了现有方法缺乏外部信息时难以补全新内容的问题。

Dandan, Zhan · Wu, Jiahao · Luo, Xing · 金枝

IEEE Transactions on Circuits and Systems for Video Technology 2024

技术优势

文本引导生成新内容

利用描述性文本提供语义信息,即使上下文不足,也能为缺失的面部部件生成合理的新内容。

多尺度多级跳跃融合

提出即插即用的多尺度多级跳跃融合模块,提取多尺度特征并将浅层特征在多个层级融入深层,充分利用已知区域信息。

跨模态特征融合

多尺度文本-图像融合模块从局部和全局尺度将文本特征融入图像特征,弥合文本与视觉模态间的鸿沟。

应用场景