多模态OCR迁移网络

免标注即达SOTA

把文本识别重构为图像描述任务,直接用统一视觉-语言预训练模型迁移,无需大规模标注数据即取得领先性能。

Lin, Junyang · Ren, Xuancheng · Zhang, Yichang · Gao, Liu · Wang, Peng · Yang, An · Zhou, Chang

2023

技术优势

无需大规模标注

模型直接从多模态预训练迁移,不依赖大规模标注或合成文本识别数据,降低了数据门槛。

中文识别SOTA

在中文文本识别基准上超过基线方法,取得当前最优性能。

媲美商业API

基于此模型构建的OCR流程能达到与产品级API相当的性能。

应用场景