平均识别准确率94%
通过结合ViT与多粒度语言信息,在未引入独立语言模型的情况下,显著提升场景文本识别精度与泛化性。
Cheng, Da · Wang, Peng · Yao, Cong
International Journal of Computer Vision 2026
在标准基准上平均识别准确率达94%,超越多数现有最优模型。
在手写和更具挑战性的场景文本数据集上均取得最优结果。