低延迟复杂请求LLM服务系统

3.7倍吞吐 / 1.6倍提升

通过统一调度预填充与解码阶段并精细化内存管理,显著提升复杂请求下大语言模型服务系统的吞吐量与延迟表现。

Dezhao, Zhai · 陈炜 · Yinghao, Ding · Yu, Ming · 李钦伟 · Wu, Hang

IEEE Transactions on Circuits and Systems for Video Technology 2025

参数信息

复杂数据集上吞吐量提升
3.7 倍
标准工作负载下吞吐量提升
1.6 倍
存碎片减少
8 %