复杂场景文本识别新范式
结合CLIP语义对齐与大语言模型推理生成了更准确的文本候选,并利用视觉-语言匹配模块挑选最佳结果,可有效处理歧义和上下文复杂的场景文本。
Zeguang, Jia · Wang J. · 宋珂慧 · Zhilan, Wang · Ma, Xiaohan · 金日泽
Neurocomputing 2026
采用跨模态预训练模型CLIP提取视觉特征,与文本内容在语义空间对齐,从而在视觉层面捕获语义线索。
基于初始识别结果,利用大语言模型生成多样化的候选文本,从而纠正局部错误并处理复杂语境。
通过视觉-语言匹配模块计算原图与每个候选文本的相似度,选出最准确的转录结果,避免错误传播。
在COCO、Uber等具有复杂真实场景的数据集上表现突出,展示了对歧义和上下文复杂文本的推理与纠正能力。