优化跨部署栈的AI推理
原标题:Optimizing AI Inference Across the Deployment Stack
AI 摘要
戴尔技术团队发表论文,提出跨部署栈的AI推理优化统一分析框架。作者将部署分解为模型层(量化、剪枝、蒸馏)、编译器层(图融合、布局优化、内核自动调优)和系统层(动态批处理、准入控制、内存分层)三层分类法,并将部署形式化为精度、延迟、吞吐、内存和能耗的多目标约束优化问题。论文还提出证据协议以解决现有基准测试条件不可比的问题,并综合了边缘平台与数据中心GPU的实证结果,指出部署结果由跨层交互决定。
正文节选
[Page 1] OPTIMIZING AI INFERENCE ACROSS THE DEPLOYMENT STACK Tejinder Singh1,† , John Pflueger2, Jeebak Mitra3 , Robert Lincourt4, Mitchell Markow2, and Bhavesh A. Patel2 1Dell Technologies, Santa Clara, CA, USA 2Dell Technologies, Round Rock, TX, USA 3De