多基准误码率创最低
该端到端神经分离系统引入教师强制与迭代解码,可应对未知说话人数,在多个基准上达到最低DER(含重叠语音)。
Chen, Zhengyang · 韩冰 · 王帅 · 钱彦旻
IEEE/ACM Transactions on Audio Speech and Language Processing 2024
通过增强模块提升帧级说话人嵌入,模型无需预先指定说话人数,且不依赖预言 VAD。
教师强制策略解决了说话人置换问题,训练过程因此收敛得更快。
迭代解码方法顺序输出每个说话人的分离结果,简化了多说话人场景的输出结构。
常用模拟数据的重叠率远高于真实数据,使用与真实数据一致的模拟训练数据可提升一致性。