无卷积Transformer口吃分类模型

88.1% 分类准确率

基于多头自注意力与位置编码的深度学习模型,能够捕捉细微的言语不流畅特征,为口吃诊断与干预提供更精准的工具。

Mishra, Nilamadhab · Chang, Hsien-Tsung

Sensors 2023

参数信息

分类准确率
88.1 %
分类准确率
80.6 %

技术优势

无卷积设计

模型完全基于自注意力机制,不依赖卷积核的局部感受野,更适合学习口吃事件中的长程时序依赖。

多类型口吃识别

能区分堵塞、延长、声音重复、词重复和插入语五种口吃类型,诊断信息更具体。

双数据集验证

在SEP-28k和FluencyBank两个独立数据集上均取得高准确率,泛化性得到验证。

应用场景