2.6倍无损加速
一个基于扩散模型的自由风格肖像动画框架,通过表情感知关键点和细粒度面部损失实现身份保持与表情迁移,配合渐进生成策略与泰勒插值缓存,在确保长期时序一致性的同时显著提升生成效率。
Ma, Yue · Zexuan, Yan · Liu, Hongyu · Wang, Hongfa · Heng, Pan · Yingqing, He · Yuan, Junkun · 曾爱玲 · Chengfei, Cai · Shum, Heungyeung · Li, Zhifeng · Liu, Wei · Zhang, Linfeng · 陳启峰
International Journal of Computer Vision 2026
采用泰勒插值缓存策略,利用扩散模型中间特征的时序连续性,跳过冗余计算,在保持输出质量不变的前提下将生成速度提升 2.6 倍,使实时应用成为可能。
表情感知关键点作为显式运动信号,能够准确对齐驱动视频中的表情,即使是夸张的表情也能忠实地迁移到参考肖像上,且减少身份泄漏。
渐进式生成策略将长视频分段生成并重用前一段的潜在特征,避免了误差累积和漂移,确保长时间动画的身份一致性和运动连贯性。