汉字文献OCR顺序检测

基于图像原生特征

通过模仿人类感知的顺序检测方法,从原始图像中提取视觉线索来推断古文固有序列,为中文历史文献的精准数字化提供上下文保留能力。

Hsing-Yuan, Ma · Huang, Hen Hsen · Liu, Chaolin

2024

技术优势

顺序检测更准

利用原始图像特征模拟人类视觉感知,而非仅依赖文本内容或版面分析,能更可靠地推断古文阅读顺序。

降低页面错误

实验表明采用该顺序检测后页面错误率有显著下降,提升整体识别质量。

应用场景