文本指引入脸修复网络

多模态引导可编辑

首创引入CLIP多模态映射,实现同一模型内文本与示例图像双条件控制,赋予面部修复可控的语义多样性与编辑灵活性。

Li, Ailin · 赵磊 · Zuo, Zhiwen · Wang, Zhizhong · 邢卫 · 鲁东明

Lecture Notes in Computer Science 2023

技术优势

一个模型两种引导

通过多模态映射网络,将文本或示例图像转换为潜在代码变化,无需为每种引导方式单独训练模型。

语义属性可控

示例语义相似度损失将修复图像与示例图像在CLIP空间中度量相似性,使生成图像包含示例的高层语义属性。

文本引导简单有效

基于优化的方法使用CLIP模型作为损失网络,迭代修改潜在代码以响应文本提示,无需对抗训练。

应用场景