有状态模型推理服务

冷启动快百倍

在支持GPU共享的无服务器平台上运行有状态模型推理服务,通过日志工作流运行时支持和双层GPU共享机制,大幅降低冷启动时间。

Zinuo, Cai · Zebin, Chen · 马汝辉 · Guan, Haibing

IEEE Journal on Selected Areas in Communications 2023

参数信息

冷启动时间降低倍数
≤100 ×

技术优势

冷启动快百倍

双层GPU共享机制充分挖掘模型间和模型内共享潜力,最高将推理任务冷启动时间降低两个数量级。

有状态执行可追踪

日志式工作流运行时确保任务有状态执行,低开销且便于错误定位和恢复。

GPU资源利用率高

双层GPU共享机制在模型间和模型内挖掘共享机会,使无服务器平台上的GPU资源得到充分利用。

应用场景