ASR至ASV迁移
一种从自动语音识别迁移到自动说话人验证的Conformer架构,通过参数迁移和优化策略,在VoxCeleb和CN-Celeb测试集上相比ECAPA-TDNN取得了竞争性表现,并实现了约11%的等错误率相对改善。
Liao, Dexin · 姜涛 · Feng, Wang · Lin, Li · 洪青阳
2023
采用长度缩放注意力(LSA)和锐度感知最小化(SAM)两种策略,提升模型在未见数据上的泛化能力。
从预训练ASR模型初始化参数后,自注意力机制能更好地建模序列特征间的关系,在VoxCeleb和CN-Celeb测试集上带来约11%的EER相对改善。
作者在ASV-Subtools中提供了运行时评估,可用于生产场景下的推理速度测试,代码与模型均已开源。