语义蒸馏场景文本超分网络

识别率最高提升24.3%

通过三叉块蒸馏预训练识别器的语义知识,并用文本感知损失增强超分图像的语义信息,大幅提升低分辨率场景文本的下游识别准确率。

赵才荣 · Rui, Shu · Feng, Shuyang · Liang, Zhu · Wang, Xuekuan

IEEE Transactions on Multimedia 2024

参数信息

ASTER识别准确率提升
17.4 %
MORAN识别准确率提升
18.2 %
CRNN识别准确率提升
24.3 %

技术优势

识别准确率显著提升

STNet通过语义蒸馏和文本感知损失,让重建图像保留更多语义信息,三种识别器的准确率均大幅提高。

跨数据集表现好

在ICDAR 2015真实场景和对敌攻击受限场景中的实验表明,加入语义信息使模型在不同数据分布下仍能稳定提升识别性能。

无需修改识别器

STNet作为前置超分模块,输出增强后的图像,可直接输入现有的ASTER、MORAN、CRNN等识别器,无需重新训练或调整识别网络。

抗敌攻击

在受限场景(防御对抗攻击)下,STNet依然能保持识别性能,说明其重建过程对扰动不敏感。

应用场景