子字符分词模型

序列缩短算得快

以字形或拼音对汉字进行子字符级切分,在保持下游性能的同时显著缩短序列长度,并提升对同音错别字的鲁棒性。

Si, Chenglei · Zhang, Zhengyan · Yingfa, Chen · Qi, Fanchao · 王晓智 · 刘知远 · Wang, Yasheng · Liu, Qun · 孙茂松

Transactions of the Association for Computational Linguistics 2023

技术优势

序列更短算得快

将汉字按字形或拼音编码为短序列后,再进行子词切分,显著减少了 token 数量,从而降低注意力计算量。

同音错别字鲁棒

基于拼音的 SubChar 分词器将同音字映射到相同的转写序列,因此错打成同音字时仍能得到相同的分词结果,模型输入保持一致。

下游性能不输

在缩短序列的同时,使用 SubChar 分词器训练的模型在下游任务上保持了与现有方法相当的性能,没有明显损失。

应用场景