视频同步音效生成模型

语义对齐音画同步

基于文本到音频预训练模型,通过语义适配器和时间适配器同时实现高质量声音生成与视频精确同步。

Yiming, Zhang · Yicheng, Gu · 曾艳红 · Zhening, Xing · Yuancheng, Wang · Wu, Zhizheng · 刘斌 · Chen Kai

International Journal of Computer Vision 2026

技术优势

音画语义对齐

通过语义适配器利用并行交叉注意力层将视频特征融入音频生成,产生与视觉内容语义相关的逼真音效。

时间同步精确

通过时间适配器从视频中估计时变信号,使音频生成与这些估计同步,增强音视频时间对齐。

音质有保障

基于预训练的文本到音频模型,确保所生成音频的高质量。

有同步数据集

引入 TikTokSound 数据集,提供与对应音频紧密相关的强清晰视觉线索,用于训练时间适配器。

应用场景