一致性评估基准

针对大模型难易倒置问题,提出可量化一致性评分的基准,揭示能力与一致性的非单调关系。

Zhe, Yang · Zhang, Yichang · Liu, Tianyu · 杨建 · Lin, Junyang · Zhou, Chang · Sui, Zhifang

2024

参数信息

一致性分数
92.2 %

技术优势

难易倒置可量化

一致性分数把模型答对难题却答错简单题的现象变成具体数字,团队可以设定阈值拦截不一致的模型版本。

更强模型更稳定

能力越强的模型通常一致性越高,少数例外揭示了架构或训练的特定问题,为选型提供线索。

用难题提分

用困难数据做微调或加入上下文示例,能系统性地提高一致性分数,是现有管线上直接可用的改进手段。

能定位分心原因

即使最强的 GPT-4 也会因冗余信息或误解题意而不一致,说明了改进方向,而不是一味扩大模型。

应用场景