24K上下文快3倍
通过结合两种互补的混合机制,在保持线性复杂度的同时取得最优的信息利用平衡,从而缩小与Transformer架构SOTA模型的性能差距。
Haowen, Hou · Ma, Fei · Zihang, Li · Yu, F. Richard
Information Fusion 2025
在 24K 上下文长度下,推理速度是 LLaVA-1.5 的 2.96 倍,大幅缩短长序列处理时间。
在同样 24K 上下文下,内存占用比 LLaVA-1.5 降低 45.38%,使更长的上下文在有限显存上可行。
在 16K 上下文下,吞吐量比混合架构 LongLLaVA 高 24%,更适合高并发服务。
在单图、多图、多视图基准上均达到 SOTA,证明线性模型也能与 Transformer 架构竞争。