多语识别达SOTA
采用长度敏感编码器和语言限制解码器,有效提升多语言文本识别性能,超越面向英语的主流模型。
Ming, Gao · Wu, Shilian · 汪增福
Lecture Notes in Computer Science 2023
在MLT-2019多语言识别基准上达到最先进结果,明显优于只针对英文设计的模型。
长度敏感编码器对长文本图像和短文本图像分别提取多尺度特征,避免长文本字符遗漏。
语言限制解码器利用语言先验信息约束输出,修正识别结果中的不合理字符。
语言均衡数据增强策略缓解多语言数据不均衡,提升模型对低频语言的识别能力。