返回全部动态

优化跨部署栈的AI推理

原标题:Optimizing AI Inference Across the Deployment Stack

arXiv cs.SE一手来源研究质量 84

AI 摘要

戴尔技术团队发表论文,提出跨部署栈的AI推理优化统一分析框架。作者将部署分解为模型层(量化、剪枝、蒸馏)、编译器层(图融合、布局优化、内核自动调优)和系统层(动态批处理、准入控制、内存分层)三层分类法,并将部署形式化为精度、延迟、吞吐、内存和能耗的多目标约束优化问题。论文还提出证据协议以解决现有基准测试条件不可比的问题,并综合了边缘平台与数据中心GPU的实证结果,指出部署结果由跨层交互决定。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] OPTIMIZING AI INFERENCE ACROSS THE DEPLOYMENT STACK Tejinder Singh1,† , John Pflueger2, Jeebak Mitra3 , Robert Lincourt4, Mitchell Markow2, and Bhavesh A. Patel2 1Dell Technologies, Santa Clara, CA, USA 2Dell Technologies, Round Rock, TX, USA 3De


发布时间:2026-09-11 12:00
抓取时间:2026-09-11 13:57
来源机构:arXiv
阅读原文arxiv.org