通过潜在空间操纵语义面部属性,并利用说话者旧视频中的说话风格,生成与音频同步的照片级逼真说话脸视频。
Salahudeen, Ridwan · Siu, Wanchi · Chan, Howard Anthony
IEEE Transactions on Consumer Electronics 2024
通过三个精心设计的损失函数确保准确的唇部同步和照片级视频重建,使生成的视频在视觉上逼真。
在与现有先进技术的对比评估中,生成的说话脸视频图像质量有显著提升。