128K 上下文化
一个从 Llama-3 继续预训练得到的 8B 语言模型,用代码仓库和书籍作为长数据源,配合高质量短上下文数据,在 128K 长度下达到同等规模模型的最优长文理解能力。
Gao, Tianyu · Alexander, Wettig · Howard, Yen · Chen, Danqi
2025
长上下文训练只用了对比模型 5% 的 token 量,就达到更优的多数任务成绩。
模型能够有效处理最长 512K 的输入,是公开可用模型中最长的上下文窗口之一。
只用短指令数据集做 SFT,就能在长上下文任务上取得强性能,省去构造昂贵的长指令数据。