注意力端到端说话人分离

多基准误码率创最低

该端到端神经分离系统引入教师强制与迭代解码,可应对未知说话人数,在多个基准上达到最低DER(含重叠语音)。

Chen, Zhengyang · 韩冰 · 王帅 · 钱彦旻

IEEE/ACM Transactions on Audio Speech and Language Processing 2024

参数信息

分离错误率(CALLHOME)
10.08 %
分离错误率(DIHARD II)
24.64 %
分离错误率(AMI)
13.00 %

技术优势

未知说话人数也能用

通过增强模块提升帧级说话人嵌入,模型无需预先指定说话人数,且不依赖预言 VAD。

训练速度更快

教师强制策略解决了说话人置换问题,训练过程因此收敛得更快。

解码逐人输出

迭代解码方法顺序输出每个说话人的分离结果,简化了多说话人场景的输出结构。

接近真实数据分布

常用模拟数据的重叠率远高于真实数据,使用与真实数据一致的模拟训练数据可提升一致性。

应用场景