HarmoniDPO视频音频生成模型

音画同步更强

用偏好优化直接对齐人类听感,生成的音频在同步性与感知质量上都更接近真实录音。

Wenshuo, Peng · Zhang, Kaipeng

International Journal of Computer Vision 2026

技术优势

保留时间动态

采用全局上下文与逐帧特征的组合表示,不丢失视频中的时间动态和语义细节,为音频同步提供更准确的视觉线索。

对齐人类偏好

通过在线直接偏好优化微调扩散模型,生成结果在感知质量和视频匹配度上更符合人类判断。

推理时提保真

双尺度扩散搜索在推理阶段自适应优化输出保真度,无需重新训练即可进一步提升音频质量。

应用场景