真实科研查询
首个以作者撰写的科研查询为核心、经专家人工校验的文献检索基准,为检索系统的真实场景评估提供了新的测试平台。
Anirudh, Ajith · Xia, Mengzhou · Alexis, Chevalier · Goyal, Tanya · Chen, Danqi · Gao, Tianyu
2024
查询由论文作者亲自撰写或从含引文的段落中生成,并经专家审核,确保捕捉真实的研究信息需求。
涵盖 597 个查询,涉及近期机器学习与自然语言处理论文,提供丰富的评估样本。
该基准显示出 BM25 与先进的稠密检索器之间存在显著性能差距,并能评估 LLM 重排序带来的进一步提升。