向量化上下文编码器

长上下文问答提速

一个小型编码器配合交叉注意力,把开放域问答的可用上下文长度扩展数倍,语言模型不必重新训练。

Zhuo, Chen · Xinyu, Wang · Jiang, Yong · Xie, Pengjun · Huang, Fei · 屠可伟

2024

参数信息

held-in数据集数量
2
held-out数据集数量
4
上下文学习设置数量
2

技术优势

上下文更长

小编码器将上下文压缩为向量,使语言模型能处理数倍于基线的上下文长度,从而覆盖更多检索片段。

计算成本低

在扩展上下文长度的同时,计算需求保持在与基线接近的水平,无需大幅增加算力即可部署。

泛化能力强

在多个held-in和held-out数据集以及两种上下文学习设置下均取得性能提升,表明方法不局限于特定数据分布。

应用场景