返回全部动态

谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架

原标题:谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

量子位研究质量 78

AI 摘要

vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消除kernel切换间的带宽空转,并利用TPU片上内存实现跨层权重预取。该代码已开源,是Inferact与Google Cloud联合工程的成果。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架 vLLM人马创业公司团队出品 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 16块谷歌TPU v7跑Kimi K3,每秒跑出了709个Token,比老黄的GB200快了57%。 做出这个成绩的,既不是造Kimi的月之暗面,也不是造TPU的谷歌,是一家叫Inferact的推理创业公司。 Inferact创始团队就是vLLM的原班人马,今年拿了a16z领投的1.5亿美元种子轮,估值8亿美元。 他们给TPU写了一种叫megakernel的推理内核,把模型推理时原本要调度的几百个小程序焊成一个大程序。 配合TPU独特的片上内存架构,megakernel把内存带宽利用率逼到了硬件理论峰值附近。 配上DeepSeek提出的DSpark加速框架,K3在TPU上跑出了前面提到的每秒709 token的成绩。 这套代码,现在已经开源。 同样16块芯片,TPU快57% Inferact把TPU和英伟达GPU放在完全相同的条件下跑了一轮benchmark,TPU赢了。 测试是用16块TPU v7 Ironwood对阵16块


发布时间:2026-09-26 15:12
抓取时间:2026-09-26 15:22
来源机构:量子位
阅读原文qbitai.com