多粒度融合场景文本识别模型

平均识别准确率94%

通过结合ViT与多粒度语言信息,在未引入独立语言模型的情况下,显著提升场景文本识别精度与泛化性。

Cheng, Da · Wang, Peng · Yao, Cong

International Journal of Computer Vision 2026

参数信息

平均识别准确率
94 %

技术优势

精度更高

在标准基准上平均识别准确率达94%,超越多数现有最优模型。

泛化性强

在手写和更具挑战性的场景文本数据集上均取得最优结果。

应用场景