RankMIL场景文本检索网络

跨模态共享特征空间

提出一种创新的序贯多示例学习(RankMIL)方法,能自适应过滤噪声样本,并配合动态局部匹配算法(DPMA)直接检索部分文本块,无需构造包,显著提升检索效率与精度。

汪浩 · 廖明辉 · Zhouyi, Xie · 刘文予 · 白翔

IEEE Transactions on Pattern Analysis and Machine Intelligence 2024

参数信息

英文文本行检索mAP提升
8.04 %
英文部分区域检索mAP提升
12.71 %
中文文本行检索mAP提升
24.45 %
中文部分区域检索mAP提升
38.06 %

技术优势

无需额外标注

采用多示例学习方法学习部分区域与查询文本的相似性,无需部分区域的标注数据。

过滤噪声样本

RankMIL方法自适应过滤训练中的噪声样本,提升训练质量。

推理不再构造包

动态部分匹配算法直接从文本行中搜索目标部分区域,无需构造包,大幅提升搜索效率。

中英文均显著提升

在英文和中文数据集上,检索性能均超越现有方法,部分区域检索提升最高达38.06% mAP。

应用场景