长上下文语言模型

128K 上下文化

一个从 Llama-3 继续预训练得到的 8B 语言模型,用代码仓库和书籍作为长数据源,配合高质量短上下文数据,在 128K 长度下达到同等规模模型的最优长文理解能力。

Gao, Tianyu · Alexander, Wettig · Howard, Yen · Chen, Danqi

2025

参数信息

上下文窗口长度
512K
长上下文训练 token 占比
5 %

技术优势

训练成本大幅降低

长上下文训练只用了对比模型 5% 的 token 量,就达到更优的多数任务成绩。

上下文窗口扩展到 512K

模型能够有效处理最长 512K 的输入,是公开可用模型中最长的上下文窗口之一。

无需长指令数据即可微调

只用短指令数据集做 SFT,就能在长上下文任务上取得强性能,省去构造昂贵的长指令数据。

应用场景