前沿数学推理
通过领域定向微调和专门奖励建模,模型在复杂数学问题上显著超越同规模现有模型。
Liu, Zihan · Yang, Chen · Shoeybi, Mohammad · Catanzaro, Bryan · Ping, Wei
2025
在复杂数学问题上大幅超越 Qwen2.5-Math-72B-Instruct、GPT-4o 和 Claude-3.5 Sonnet。
AceMath-72B-RM 在多个基准上持续超越最先进的奖励模型。
将 AceMath-72B-Instruct 与 AceMath-72B-RM 结合,在数学推理基准上取得最高平均 rm@8 得分。