语义保真嵌入网络

即插即用

面向扩散模型的个性化生成,在保持主体身份的同时,提升对场景、动作和面部属性的精细可控性。

李杨 · Yang, Songlin · 王伟 · 董晶

IEEE Transactions on Circuits and Systems for Video Technology 2025

技术优势

单图即可个性化

仅需一张目标主体图像就能学习出准确且可交互的主体嵌入,免去多图采集和繁琐微调。

能交互生成其他概念

生成图像在保持主体身份的同时,能正确响应场景、动作和面部属性等提示词,而以往方法会丢失这种交互生成能力。

身份保真更精准

引入主体感知注意力损失,将主体嵌入引导到具有高主体身份相似度和多样交互生成能力的流形上,在面部基准上达到最先进准确率。

语义控制更精细

将单个主体表示优化为多个分阶段令牌,每个令牌包含两个解耦特征,扩展了文本条件空间,从而提升对主体外观和属性的精细控制。

应用场景