针对大模型难易倒置问题,提出可量化一致性评分的基准,揭示能力与一致性的非单调关系。
Zhe, Yang · Zhang, Yichang · Liu, Tianyu · 杨建 · Lin, Junyang · Zhou, Chang · Sui, Zhifang
2024
一致性分数把模型答对难题却答错简单题的现象变成具体数字,团队可以设定阈值拦截不一致的模型版本。
能力越强的模型通常一致性越高,少数例外揭示了架构或训练的特定问题,为选型提供线索。
用困难数据做微调或加入上下文示例,能系统性地提高一致性分数,是现有管线上直接可用的改进手段。
即使最强的 GPT-4 也会因冗余信息或误解题意而不一致,说明了改进方向,而不是一味扩大模型。