无需人工标注
一种为数学推理每一步自动打分的奖励模型,用自动构造的过程监督数据训练,摆脱对人工标注的依赖,可验证和强化大语言模型。
Peiyi, Wang · Li, Lei · 邵智宏 · Xu, Runxin · Dai, Damai · Yifei, Li · Chen, Deli · Yu, Wu · Sui, Zhifang
2024
训练数据由自动构造的过程级监督生成,摆脱了对人工标注的依赖。
用MATH-SHEPHERD对候选解重排序,Mistral-7B在GSM8K上准确率从84.1%提升到89.1%,在MATH上从33.0%提升到43.5%。