长上下文评估
一个可自动评分的合成任务,用于评估长上下文LLM和RAG系统的摘要与引用能力。
Laban, Philippe · Fabbri, Alexander Richard · Xiong, Caiming · Wu, Chiensheng
2024
通过精确掌握干草堆中应出现的见解和应引用的文档,实现了高度可复现的自动评估,可对摘要的覆盖度和引用质量打分。
即使有文档相关性的Oracle信号,系统联合得分仍比估计人类表现低10+个百分点;无检索器时GPT-4o和Claude 3 Opus得分低于20%。
SummHay可用于研究企业RAG系统和长上下文模型中的位置偏差。