15B双语非对称Seq2Seq模型

380B tokens 即达顶尖性能

OpenBA是一个从头预训练的开源15B双语非对称Seq2Seq模型,在多个中文与多语基准上超越更大规模模型。

李俊涛 · Zecheng, Tang · Yuyang, Ding · Pinzheng, Wang · Pei, Guo · Wangjie, You · Dan, Qiao · Wang, Chenyu · 陈文亮 · 付国宏 · Qiaoming, Zhu · 周国栋 · 张旻

Science China Information Sciences 2025

参数信息

预训练 token 量
380 B

技术优势

380B tokens 即达顶尖性能

仅用380B tokens预训练,即在多个基准上超越参数量更大的模型,有效降低预训练成本。

超越更大规模模型

在BELEBELE、MMLU、C-Eval (hard)上分别超越LLaMA-70B、BLOOM-176B、GLM-130B,验证了模型设计的有效性。

非对称架构高效

采用非对称Seq2Seq结构,并配有增强技术和三阶段训练策略,在性能和效率之间取得平衡。

开箱即用

代码已按Huggingface Transformers设计原则重构,并提供各阶段检查点,方便开发者直接加载。

应用场景