PCIe显卡被低估:Meta-Infer软件优化让DeepSeek推理吞吐提升近7倍
原标题:PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
AI 摘要
是石科技(METASTONE)推出自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四类纯软件优化手段,在不改动模型结构和权重的前提下挖掘PCIe-Only GPU的推理潜力。在DeepSeek-V4.1-Flash上,8张PCIe显卡的输入吞吐从社区基线1932 tok/s提升至13274 tok/s,实现6.87倍提升,并支持1M超长上下文;该方案在DeepSeek-V4-Flash、GLM5.3、MiniMax H3视频生成模型及国产GPU上同样得到验证。文章认为,在高端算力成本高企的背景下,深度软件优化可让成本更低的PCIe GPU在部分推理指标上向高端硬件靠拢。
正文节选
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 1.5台6000D跑赢1台B300! 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升,GPU卡的采购成本、供给约束持续加剧。 AI推理的竞争正在悄然发生转向:不再单纯比拼“谁能够买到性能最顶级的硬件”,而是转向“谁可以把手中已有的算力资源用得更值”。 很多GPU卡,开源框架能够完成模型加载、权重下载、服务拉起,实现“能跑起来”,但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。 这类GPU卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。 是石科技(METASTONE)是一家“独立第三方全栈算力运营商”的科技企业。不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力