数学过程奖励模型

无需人工标注

一种为数学推理每一步自动打分的奖励模型,用自动构造的过程监督数据训练,摆脱对人工标注的依赖,可验证和强化大语言模型。

Peiyi, Wang · Li, Lei · 邵智宏 · Xu, Runxin · Dai, Damai · Yifei, Li · Chen, Deli · Yu, Wu · Sui, Zhifang

2024

参数信息

GSM8K 准确率(过程强化学习后)
84.1 %
MATH 准确率(过程强化学习后)
33.0 %
GSM8K 准确率(验证后)
89.1 %
MATH 准确率(验证后)
43.5 %

技术优势

不用人工标注

训练数据由自动构造的过程级监督生成,摆脱了对人工标注的依赖。

验证大幅提分

用MATH-SHEPHERD对候选解重排序,Mistral-7B在GSM8K上准确率从84.1%提升到89.1%,在MATH上从33.0%提升到43.5%。

应用场景