语义对齐音画同步
基于文本到音频预训练模型,通过语义适配器和时间适配器同时实现高质量声音生成与视频精确同步。
Yiming, Zhang · Yicheng, Gu · 曾艳红 · Zhening, Xing · Yuancheng, Wang · Wu, Zhizheng · 刘斌 · Chen Kai
International Journal of Computer Vision 2026
通过语义适配器利用并行交叉注意力层将视频特征融入音频生成,产生与视觉内容语义相关的逼真音效。
通过时间适配器从视频中估计时变信号,使音频生成与这些估计同步,增强音视频时间对齐。
基于预训练的文本到音频模型,确保所生成音频的高质量。
引入 TikTokSound 数据集,提供与对应音频紧密相关的强清晰视觉线索,用于训练时间适配器。