3.7倍吞吐 / 1.6倍提升
通过统一调度预填充与解码阶段并精细化内存管理,显著提升复杂请求下大语言模型服务系统的吞吐量与延迟表现。
Dezhao, Zhai · 陈炜 · Yinghao, Ding · Yu, Ming · 李钦伟 · Wu, Hang
IEEE Transactions on Circuits and Systems for Video Technology 2025