88.1% 分类准确率
基于多头自注意力与位置编码的深度学习模型,能够捕捉细微的言语不流畅特征,为口吃诊断与干预提供更精准的工具。
Mishra, Nilamadhab · Chang, Hsien-Tsung
Sensors 2023
模型完全基于自注意力机制,不依赖卷积核的局部感受野,更适合学习口吃事件中的长程时序依赖。
能区分堵塞、延长、声音重复、词重复和插入语五种口吃类型,诊断信息更具体。
在SEP-28k和FluencyBank两个独立数据集上均取得高准确率,泛化性得到验证。