免标注即达SOTA
把文本识别重构为图像描述任务,直接用统一视觉-语言预训练模型迁移,无需大规模标注数据即取得领先性能。
Lin, Junyang · Ren, Xuancheng · Zhang, Yichang · Gao, Liu · Wang, Peng · Yang, An · Zhou, Chang
2023
模型直接从多模态预训练迁移,不依赖大规模标注或合成文本识别数据,降低了数据门槛。
在中文文本识别基准上超过基线方法,取得当前最优性能。
基于此模型构建的OCR流程能达到与产品级API相当的性能。