即插即用
面向扩散模型的个性化生成,在保持主体身份的同时,提升对场景、动作和面部属性的精细可控性。
李杨 · Yang, Songlin · 王伟 · 董晶
IEEE Transactions on Circuits and Systems for Video Technology 2025
仅需一张目标主体图像就能学习出准确且可交互的主体嵌入,免去多图采集和繁琐微调。
生成图像在保持主体身份的同时,能正确响应场景、动作和面部属性等提示词,而以往方法会丢失这种交互生成能力。
引入主体感知注意力损失,将主体嵌入引导到具有高主体身份相似度和多样交互生成能力的流形上,在面部基准上达到最先进准确率。
将单个主体表示优化为多个分阶段令牌,每个令牌包含两个解耦特征,扩展了文本条件空间,从而提升对主体外观和属性的精细控制。