多模态对齐网络

10秒视频生成风格化动画

该网络从极短的参考视频中学习个体说话风格,并能生成具有逼真面部表情和头部姿势的语音驱动3D动画。

陈里洋 · Weihong, Bao · Lei, Shun · 75858338 · 吴志勇 · Kang, Shiyin · Huang, Haozhi · Meng, Helen Mei Ling

IEEE Transactions on Multimedia 2025

技术优势

10秒视频即可捕捉风格

从极短的参考视频中学习个性化说话风格,无需大量训练数据。

高效微调捕获表情风格

使用MoLoRA高效微调表情适配器,捕获面部表情风格。

无需微调的姿态风格化

通过构建离散姿态先验和语义感知姿态风格矩阵检索风格嵌入,实现姿态风格化。

应用场景