多模态引导可编辑
首创引入CLIP多模态映射,实现同一模型内文本与示例图像双条件控制,赋予面部修复可控的语义多样性与编辑灵活性。
Li, Ailin · 赵磊 · Zuo, Zhiwen · Wang, Zhizhong · 邢卫 · 鲁东明
Lecture Notes in Computer Science 2023
通过多模态映射网络,将文本或示例图像转换为潜在代码变化,无需为每种引导方式单独训练模型。
示例语义相似度损失将修复图像与示例图像在CLIP空间中度量相似性,使生成图像包含示例的高层语义属性。
基于优化的方法使用CLIP模型作为损失网络,迭代修改潜在代码以响应文本提示,无需对抗训练。