免视觉枢轴对齐
该模型直接从音频生成文本进行预训练,消除了视觉模态引入的噪声,在多个零样本音频分类数据集上达到领先性能。
Xu, Xuenan · Zhang, Zhiling · Zhou, Zelin · Pingyue, Zhang · Xie, Zeyu · 吴梦玥 · Zhu, Kenny Qili
2023
直接由音频生成文本,避免了以视觉为桥梁时模态不匹配带来的噪声。
在AudioSet标签引导下生成描述,使合成文本更准确。
构建了约4500万条高质量平行音频-文本数据用于预训练。