文献检索基准集

真实科研查询

首个以作者撰写的科研查询为核心、经专家人工校验的文献检索基准,为检索系统的真实场景评估提供了新的测试平台。

Anirudh, Ajith · Xia, Mengzhou · Alexis, Chevalier · Goyal, Tanya · Chen, Danqi · Gao, Tianyu

2024

参数信息

查询数量
597
Recall@5 绝对差距(最佳稠密检索器 vs BM25)
24.8 %
最佳稠密检索器通过 LLM 重排序的提升
4.4 %

技术优势

查询真实可信

查询由论文作者亲自撰写或从含引文的段落中生成,并经专家审核,确保捕捉真实的研究信息需求。

评测覆盖面广

涵盖 597 个查询,涉及近期机器学习与自然语言处理论文,提供丰富的评估样本。

能区分模型实力

该基准显示出 BM25 与先进的稠密检索器之间存在显著性能差距,并能评估 LLM 重排序带来的进一步提升。

应用场景