超越现有开源
通过共识过滤机制,该模型在数学推理中比现有开源PRM更准确地识别中间错误,数据效率更高。
Zhenru, Zhang · Chujie, Zheng · Yangzhen, Wu · 75793300 · Runji, Lin · Yu, Bowen · Liu, Dayiheng · 周靖人 · Lin, Junyang
2025
发布的新模型在 Best-of-N 评估中优于现有开源替代方案。
共识过滤机制将 MC 估计与 LLM-as-a-judge 结合,在提升性能的同时减少对标注数据的依赖。
揭示了传统 Best-of-N 评估中的潜在偏差,并提出结合响应级与步骤级指标的更全面评估框架。