AceMath-72B数学推理模型

前沿数学推理

通过领域定向微调和专门奖励建模,模型在复杂数学问题上显著超越同规模现有模型。

Liu, Zihan · Yang, Chen · Shoeybi, Mohammad · Catanzaro, Bryan · Ping, Wei

2025

技术优势

超越同规模竞品

在复杂数学问题上大幅超越 Qwen2.5-Math-72B-Instruct、GPT-4o 和 Claude-3.5 Sonnet。

奖励模型更强

AceMath-72B-RM 在多个基准上持续超越最先进的奖励模型。

组合效果最佳

将 AceMath-72B-Instruct 与 AceMath-72B-RM 结合,在数学推理基准上取得最高平均 rm@8 得分。

应用场景