TH-Mamba 说话头生成网络

清晰度显著提升

通过帧内与帧间 Mamba 模块联合挖掘说话头的空间与时序相关性,实现高保真、低抖动的音画同步视频生成。

徐新 · Zhixi, Yu · 江奎 · 冯骁骋 · Lin, Chiawen

IEEE Transactions on Circuits and Systems for Video Technology 2025

参数信息

PSNR 提升(HDTF)
0.78 dB
PSNR 提升(Mead-Neutral)
1.55 dB

技术优势

画质不抖

帧间 Mamba 模块挖掘连续帧的互补信息,为运动模拟提供线索,从而在时序上减少抖动。

五官不歪

帧内 Mamba 模块提取源图像的人脸特征,约束生成帧与当前源帧的内容一致,从而避免面部结构畸变。

训练更稳

关键点约束、多尺度内容约束和位移约束三者共同作用,提升训练稳定性,从而减小生成帧之间的不连续跳动。

效果领先

在 HDTF 和 Mead-Neutral 数据集上均显著优于现有最佳方法,PSNR 分别提高 0.78 dB 和 1.55 dB。

应用场景