大幅动作不失真
用音频生成的运动掩模显式引导扩散模型,让大幅手势和面部细节都能与语音同步生成。
Siyuan, Wang · Jiawei, Liu · 王伟 · Yeying, Jin · Du, Jinsong · 韩志
IEEE Transactions on Circuits and Systems for Video Technology 2025
运动掩模显式标示出面部和手势等关键区域,让模型在这些区域集中注意力生成,避免细节丢失。
层次化音频注意力机制让模型在扩散过程中对语音信号保持敏感,从而提升唇音同步和手势生成的准确性。
从同一音频输入派生姿态和掩模,不需要额外的先验输入,降低了实际应用的复杂度。