BLAT语音文本预训练模型

免视觉枢轴对齐

该模型直接从音频生成文本进行预训练,消除了视觉模态引入的噪声,在多个零样本音频分类数据集上达到领先性能。

Xu, Xuenan · Zhang, Zhiling · Zhou, Zelin · Pingyue, Zhang · Xie, Zeyu · 吴梦玥 · Zhu, Kenny Qili

2023

参数信息

零样本音频分类准确率
94.5 %
零样本音频-文本检索Recall@10
67.2 %

技术优势

免视觉枢轴

直接由音频生成文本,避免了以视觉为桥梁时模态不匹配带来的噪声。

标签引导描述

在AudioSet标签引导下生成描述,使合成文本更准确。

大规模数据

构建了约4500万条高质量平行音频-文本数据用于预训练。

应用场景