Graft推理服务系统

资源效率提升70%

面向混合深度学习的推理服务系统,通过DNN重排列让异构网络片段共享层,把碎片化负载变得可批处理。

Jing, Wu · Wang, Lin · Qirui, Jin · 刘方明

IEEE Transactions on Parallel and Distributed Systems 2023

参数信息

资源效率提升高
70 %

技术优势

异构片段可共享层

DNN重排列让不同的网络片段重组,共享相同层,将非均匀负载转化为规则批处理请求。

延迟SLO有保证

通过合并、分组和重排列算法最大化批处理机会,在满足延迟SLO的前提下最小化资源消耗。

细粒度GPU复用

Graft采用细粒度GPU资源复用,让多个DNN片段高效共存于同一GPU,减少资源闲置。

应用场景