干草堆摘要任务

长上下文评估

一个可自动评分的合成任务,用于评估长上下文LLM和RAG系统的摘要与引用能力。

Laban, Philippe · Fabbri, Alexander Richard · Xiong, Caiming · Wu, Chiensheng

2024

参数信息

联合得分差距
10+ points
无检索器联合得分
20 %

技术优势

可复现自动评分

通过精确掌握干草堆中应出现的见解和应引用的文档,实现了高度可复现的自动评估,可对摘要的覆盖度和引用质量打分。

揭示当前系统不足

即使有文档相关性的Oracle信号,系统联合得分仍比估计人类表现低10+个百分点;无检索器时GPT-4o和Claude 3 Opus得分低于20%。

适用于企业RAG研究

SummHay可用于研究企业RAG系统和长上下文模型中的位置偏差。

应用场景