扩散音频字幕模型

兼顾多样与准确

将BART语言模型融入扩散过程,并引入检索引导的朗之万动力学,使生成的音频描述在准确性和多样性上均优于现有系统。

Zhu, Yonggang · 门爱东 · 晓丽

Information Fusion 2025

技术优势

多样性逼近人类

扩散模型天然能生成多样样本,配合检索引导的朗之万动力学,生成文本在保持准确的同时展现人类水平的多样性。

准确率不妥协

融入BART语言模型,利用预训练语言知识修正扩散模型的文本生成,避免准确率下降。

生成与音频对齐

检索引导的朗之万动力学在运行时动态将生成字幕与目标音频对齐,提高相关性。

应用场景