说话人脸生成模型

分段推理降噪

在推理阶段通过分段静态参考抑制时序噪声,在不改变网络结构的前提下显著提升音视频同步质量。

Zige, Wang · Yashuai, Wang · Tianyu, Liu · 张蓬 · 谢磊 · 郭阳明

IEEE Transactions on Consumer Electronics 2025

技术优势

推理更稳定

通过将输入视频分段,有效降低推理过程的复杂度,从而减少时序扰动对生成结果的干扰。

音画更同步

利用静态人脸参考抑制动态序列产生的时序噪声,提升生成输出的音视频同步性。

不改结构免训练

策略仅在推理阶段使用,无需修改网络架构或重新训练,可直接接入现有模型。

应用场景