运动掩模双段手势网络

大幅动作不失真

用音频生成的运动掩模显式引导扩散模型,让大幅手势和面部细节都能与语音同步生成。

Siyuan, Wang · Jiawei, Liu · 王伟 · Yeying, Jin · Du, Jinsong · 韩志

IEEE Transactions on Circuits and Systems for Video Technology 2025

技术优势

大幅动作不失真

运动掩模显式标示出面部和手势等关键区域,让模型在这些区域集中注意力生成,避免细节丢失。

唇语和手势更同步

层次化音频注意力机制让模型在扩散过程中对语音信号保持敏感,从而提升唇音同步和手势生成的准确性。

只用音频和图片

从同一音频输入派生姿态和掩模,不需要额外的先验输入,降低了实际应用的复杂度。

应用场景