区块级阅读顺序检测模型

错误率降91%

以学习排序取代n-gram启发式,在古籍OCR中将位置错误率从61.7%降至5.4%,并大幅减少所需标注数据。

Hsing-Yuan, Ma · Liu, Chaolin · Huang, Hen Hsen

Multimedia Tools and Applications 2025

参数信息

位置错误率
5.4 %
较启发式方法相对降低
91.3 %
较MLP相对降低
90.4 %

技术优势

错误率降91%

在MTHv2数据集上,位置错误率从启发式方法的61.7%降至5.4%,相对降低91.3%,大幅减少后处理人工校对工作量。

不用n-gram

该区块方法不依赖n-gram技术,而是通过学习排序对文本块排序,并在块内按顺序拼接文本,免去了语言模型的预训练与维护。

数据需求低

额外实验表明,达到满意的阅读顺序检测质量所需的数据量远低于一般预期,降低了古籍领域的标注成本。

已实测

团队在AAAI会议上演示了功能完整的原型系统,其实际性能为设计有效性和可扩展性提供了实据,也可迁移至日文等场景。

应用场景