返回全部动态
AI SSD:大模型推理的存储范式转移
AI 摘要
本文探讨了AI基础设施中存储角色的转变,指出大模型推理正从堆叠计算资源转向协同计算、网络、内存与存储的数据路径。月之暗面的Mooncake和NVIDIA的CMX分别从软件架构和硬件平台层面将KV Cache等推理状态作为一级资源管理,推动SSD进入Token生成的实时主链路。文章还分析了群联、江波龙和寅谱-联芸三条推理参与型AI SSD技术路线,强调AI SSD竞争最终是完整数据路径的竞争。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
AI SSD:大模型推理的存储范式转移 算力、网络、内存与存储开始围绕每个Token协同 允中 发自 凹非寺 量子位 | 公众号 QbitAI 过去两年,AI基础设施的竞争主要围绕GPU数量、芯片算力、HBM带宽和高速网络展开。 但随着大模型进入长上下文、复杂推理和多智能体阶段,决定一套系统能够产出多少有效Token的因素正在变得更加复杂。 GPU依然是算力底座,其实际利用率却越来越取决于模型权重、KV Cache和MoE专家能否在正确的时间到达正确的计算节点。 - 如果KV Cache无法及时复用,系统就需要重新执行Prefill; - 如果MoE专家权重没有在路由发生前进入内存,GPU便可能停下来等待数据; - 如果大量推理状态长期占据HBM,又会压缩并发请求和有效批处理的空间。 AI Infra由此正在从“堆叠计算资源”进入“协同计算、网络、内存与存储数据路径”的新阶段。 月之暗面的Mooncake与NVIDIA推出的CMX,构成了这一变化的两个代表性信号。 月之暗面从大规模推理软件架构出发,把分散在集群中的CPU、DRAM、SSD和NIC组织为可调度的KV Cache资源; N
发布时间:2026-08-07 10:56
抓取时间:2026-08-07 14:19
来源机构:量子位