音画同步更强
用偏好优化直接对齐人类听感,生成的音频在同步性与感知质量上都更接近真实录音。
Wenshuo, Peng · Zhang, Kaipeng
International Journal of Computer Vision 2026
采用全局上下文与逐帧特征的组合表示,不丢失视频中的时间动态和语义细节,为音频同步提供更准确的视觉线索。
通过在线直接偏好优化微调扩散模型,生成结果在感知质量和视频匹配度上更符合人类判断。
双尺度扩散搜索在推理阶段自适应优化输出保真度,无需重新训练即可进一步提升音频质量。