380B tokens 即达顶尖性能
OpenBA是一个从头预训练的开源15B双语非对称Seq2Seq模型,在多个中文与多语基准上超越更大规模模型。
李俊涛 · Zecheng, Tang · Yuyang, Ding · Pinzheng, Wang · Pei, Guo · Wangjie, You · Dan, Qiao · Wang, Chenyu · 陈文亮 · 付国宏 · Qiaoming, Zhu · 周国栋 · 张旻
Science China Information Sciences 2025
仅用380B tokens预训练,即在多个基准上超越参数量更大的模型,有效降低预训练成本。
在BELEBELE、MMLU、C-Eval (hard)上分别超越LLaMA-70B、BLOOM-176B、GLM-130B,验证了模型设计的有效性。
采用非对称Seq2Seq结构,并配有增强技术和三阶段训练策略,在性能和效率之间取得平衡。
代码已按Huggingface Transformers设计原则重构,并提供各阶段检查点,方便开发者直接加载。