混合机制线性VLM

24K上下文快3倍

通过结合两种互补的混合机制,在保持线性复杂度的同时取得最优的信息利用平衡,从而缩小与Transformer架构SOTA模型的性能差距。

Haowen, Hou · Ma, Fei · Zihang, Li · Yu, F. Richard

Information Fusion 2025

参数信息

加速比
2.96
内存占用降低
45.38 %
吞吐量提升
24 %

技术优势

快 2.96 倍

在 24K 上下文长度下,推理速度是 LLaVA-1.5 的 2.96 倍,大幅缩短长序列处理时间。

省内存 45%

在同样 24K 上下文下,内存占用比 LLaVA-1.5 降低 45.38%,使更长的上下文在有限显存上可行。

吞吐提升 24%

在 16K 上下文下,吞吐量比混合架构 LongLLaVA 高 24%,更适合高并发服务。

SOTA 性能

在单图、多图、多视图基准上均达到 SOTA,证明线性模型也能与 Transformer 架构竞争。

应用场景